본문으로 건너뛰기
X (Twitter)조회 3

Wan3.0 확산, Kimi-K3 대형 문맥, 언어별 추론 격차와 저비용 평가 기법

Wan3.0의 서비스 확산과 Kimi-K3의 대형 문맥, 언어·학습·평가 효율화 연구

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 포스트는 Wan3.0의 일반 공개와 여러 서비스로의 확산을 중심으로, Kimi-K3의 2.8T 파라미터·100만 토큰 문맥, 언어별 LLM reasoning 격차, 대규모 MoE 학습과 harness 평가 비용을 줄이는 방법을 함께 다뤘다. Wan3.0은 텍스트·이미지·오디오·비디오·웹페이지·문서를 입력으로 받아 최대 30초 영상을 한 번에 생성하고, Qwen Cloud에서는 480p 초당 0.05달러부터 가격이 책정됐다. 연구 포스트에서는 영어 reasoning 전환에 따른 성능 회복, 작은 proxy model을 이용한 learning rate 전이, 불일치가 큰 task 중심의 검증 샘플링이 핵심으로 나타났다. OpenMHC는 wearable data와 clinical data를 잇는 공개 연구 기반으로, Grok은 ESP32-S에서 DOOM 전체를 높은 frame rate로 실행한 사례로 언급됐다.

𝕏 실시간 트렌드 토픽

🔥 Wan3.0의 30초 영상 생성과 서비스 확산포스트 15

Wan3.0이 일반 공개된 뒤 Alibaba Cloud와 Qwen Cloud뿐 아니라 NadouPro, DeeVid AI, Segmind, Venice, fal, TapNow AI, PolloAI 등으로 제공 범위를 넓혔다. 최대 30초 단일 생성, 다중 형식 참조, 최대 1080p 렌더링과 할인·초당 과금이 반복해서 언급됐다.

세부 내용 보기
  • Wan3.0은 영상 조각을 이어 붙이지 않고 한 번의 pass에서 2~30초 영상을 생성하며, 텍스트·이미지·오디오·비디오·웹페이지·문서·스프레드시트·슬라이드를 참조 입력으로 받는다. 입력 형식을 넓힌 Omni-Reference와 motion·lighting·physical details의 장면 일관성 개선이 여러 배포 서비스의 공통 설명으로 나타났다.
  • Alibaba Wan 팀은 aesthetic experts와 creative consultants의 기준, 여러 visual domain을 포함한 pre-training dataset을 Wan3.0의 visual quality 기반으로 제시했다. 기능 축은 Native 30-Second Video Generation, Omni-Reference, Reality-Grade Rendering, Dynamic Motion이며, 최대 1080p와 expressive faces가 함께 언급돼 filmmaking workflow에서 긴 단일 테이크와 현실적인 움직임을 겨냥한 구조가 확인됐다.
  • Qwen Cloud의 Standard API 가격은 480p 초당 0.05달러, 720p 초당 0.10달러, 1080p 초당 0.20달러이며 8월 23일부터 9월 23일까지 30% 할인 혜택이 제공된다. 여러 외부 서비스가 같은 모델을 연결하면서 사용자는 단일 모델 출시를 넘어 API·시각화 UI·익명 생성·영상 제작 workflow별 접근 경로를 선택할 수 있게 됐다.
원문 트윗 2개 보기

📈 Kimi-K3의 2.8T 파라미터와 100만 토큰 문맥포스트 1

Kimi-K3가 2.8T parameters와 native 1M-token context를 내세워 공개됐다. repo-scale engineering, visual creation, 자체 다음 행동을 계획하는 agents를 주요 사용 대상으로 삼고 Model Studio와 Qwen Cloud에서 100만 토큰 무료 체험을 제공한다.

세부 내용 보기
  • Kimi-K3는 2.8T parameters와 native 1M-token context를 모델의 핵심 사양으로 내세우며, 긴 문맥을 활용하는 repo-scale engineering과 visual creation, 다음 행동을 스스로 계획하는 agents를 대상으로 한다. 포스트는 모델의 내부 처리 절차나 벤치마크 수치를 추가로 제시하지 않고, 대규모 문맥과 agent 활용 범위를 제품 메시지로 묶었다.
  • 무료 1M-token trial은 Alibaba Cloud Model Studio와 Qwen Cloud에서 제공된다. 긴 저장소 단위 입력과 agent 계획 작업을 한 번에 시험할 수 있는 접점이 마련됐다는 점에서, Kimi-K3의 차별점은 단순 파라미터 수보다 입력 문맥 규모와 적용 범위에 맞춰져 있다.
원문 트윗 1개 보기

📈 LLM skill의 언어 의존성포스트 1

같은 multilingual LLM이라도 reasoning에 사용하는 언어에 따라 동일한 skill의 성능이 달라질 수 있다는 연구가 공유됐다. 게임·규칙·행동을 고정하고 언어만 바꾼 자기 대결에서 격차가 나타났으며, 일부 경우 reasoning 언어를 English로 바꾸자 손실된 성능 대부분이 회복됐다.

세부 내용 보기
  • 연구는 같은 모델이 서로 다른 언어로 동일한 게임을 수행하도록 구성해 game, rules, actions를 고정하고 reasoning language만 변화시켰다. 이 통제 방식은 모델 능력 자체의 차이와 언어가 그 능력에 접근하는 과정의 차이를 분리하려는 실험 구조다.
  • 언어별 reasoning과 strategy 성능에는 큰 격차가 나타났고, 일부 사례에서는 reasoning만 English로 전환해 lost performance의 대부분을 회복했다. 따라서 모델 안에 skill이 존재하더라도 입력과 사고에 쓰는 언어가 그 skill의 접근성과 실제 사용 결과를 좌우할 수 있다는 해석으로 이어진다.
원문 트윗 1개 보기

Proxy model에서 대규모 MoE로 learning rate 전이포스트 1

100B 이상 MoE의 learning rate 탐색 비용을 줄이기 위해 작은 proxy model의 결과를 대규모 학습으로 옮기는 연구가 공유됐다. µP가 최적 learning rate를 model scale에 맞춰 전이하고 scaling law로 더 많은 training token에 필요한 변화를 예측해 155B MoE와 10T tokens 설정에 적용했다.

세부 내용 보기
  • 모델 크기나 training length가 바뀔 때마다 전체 sweep을 반복하면 100B 이상 MoE의 hyperparameter tuning 비용이 커진다. 연구는 작은 proxy model에서 learning rate를 탐색한 뒤 µP로 model scale에 맞는 값을 전이하고, scaling law로 training token 증가에 따른 조정 폭을 계산하는 입력·전이·예측 절차를 사용했다.
  • 이 방법으로 155B MoE를 10T tokens로 학습할 때 필요한 learning rate를 훨씬 저렴한 proxy run에서 선택했다. 대규모 모델마다 독립적인 sweep을 수행하던 구조를 작은 실험과 전이 규칙으로 대체해 compute 부담을 낮추는 접근이다.
원문 트윗 1개 보기

불일치 task 중심의 harness 평가 절감포스트 1

Task-CoEvolve는 모든 validation task에서 후보 harness를 반복 평가하는 대신 후보 간 불일치가 큰 task를 우선 샘플링하는 방법을 사용한다. Terminal-Bench 2.1에서 전체 평가의 20%만으로 최종 성능을 거의 유지하고 search cost를 67~80% 줄였다.

세부 내용 보기
  • Harness optimization에서는 이미 너무 쉽거나 어려운 task까지 모든 후보에 반복 적용해 compute를 소모한다. Task-CoEvolve는 후보 harness들이 서로 다른 결과를 내는 task를 계속 샘플링하고, 그 표본 편향을 보정해 전체 validation set 성능을 추정하는 방식으로 평가 순서를 바꿨다.
  • Terminal-Bench 2.1에서 최종 성능은 거의 같은 수준으로 유지하면서 evaluations를 20%만 수행했고 search cost는 67~80% 감소했다. 후보 간 차이가 큰 task에 검증 자원을 집중하면 전체 task를 매번 재실행하지 않고도 harness 탐색 결과를 추정할 수 있다는 점이 핵심이다.
원문 트윗 1개 보기

웨어러블·임상 데이터 공개 기반 OpenMHC포스트 1

웨어러블 데이터와 임상 데이터를 결합한 조기 진단·환자 연속 모니터링의 기반으로 OpenMHC가 언급됐다. 현재 대규모 wearable health research data와 모델이 닫혀 있거나 접근 제한을 받으며 공유 benchmark가 부족하다는 문제가 배경으로 제시됐다.

세부 내용 보기
  • 웨어러블 데이터는 널리 수집되지만 대규모 연구용 데이터는 충분히 공개되지 않았고, 관련 dataset과 model이 closed 또는 heavily gated 상태이며 shared benchmark도 드물다. OpenMHC는 이 개방성 병목을 바꾸기 위한 첫 단계로 공개됐다고 인용됐다.
  • 웨어러블 신호와 clinical data를 결합하면 환자가 아픈 뒤 대응하는 방식에서 벗어나 조기 진단과 continuous monitoring을 지원할 수 있다. 다만 포스트는 OpenMHC의 구체적인 데이터 규모나 모델 성능 수치를 제시하지 않고, 분절되고 닫힌 의료 데이터 환경을 여는 연구 기반이라는 역할만 담고 있다.
원문 트윗 1개 보기

Grok의 ESP32-S 기반 DOOM 실행포스트 1

Grok이 ESP32-S에서 DOOM 전체를 높은 frame rate로 포팅해 실행했다는 사례가 공유됐다. 대화형 모델의 코드 생성 또는 포팅 결과가 제한된 임베디드 환경에서 실제 실행으로 이어졌다는 점이 핵심이다.

세부 내용 보기
  • 포스트는 Grok이 DOOM 전체를 ESP32-S로 port하고 high frame rate로 실행했다고 밝힌다. 대상 하드웨어와 실행 결과는 언급됐지만, 사용한 코드·메모리 구성·정확한 frame rate·검증 절차는 공개되지 않았다.
  • 일반적인 코드 답변이 아니라 게임 전체를 특정 임베디드 보드에서 구동한 사례라는 점에서, 모델 출력의 가치는 소스 코드 생성에 머무르지 않고 target hardware에 맞춘 포팅과 실행 가능성으로 평가된다.
원문 트윗 1개 보기

📈 AI Agents 기반 Model-as-a-Service 구축포스트 1

Alibaba Cloud Smart Studio가 AI Agents를 이용해 몇 시간 안에 자체 Model-as-a-Service를 구축하는 경로를 내세웠다. BYO-Compute와 BYO-Key를 통해 model serving·cluster management·Tokenization 또는 LLM API 재판매를 묶고, 온라인 activation과 deployment를 자동화한다.

세부 내용 보기
  • Smart Studio는 사용자가 compute를 직접 가져오면 end-to-end model serving, cluster management, Tokenization을 처리하고, key를 가져오면 top LLM APIs를 별도 구축 없이 재판매할 수 있도록 구성됐다. AI Agents가 online activation과 deployment를 자동화해 서비스 출시 과정의 운영 단계를 묶는 방식이다.
  • 포스트는 이 플랫폼이 AI business를 시작하려는 사용자를 대상으로 하며 self-activate 경로를 제공한다고 설명한다. 가격, 지원 모델 목록, 실제 배포 시간의 검증 수치는 없지만, 모델 자체보다 serving·cluster·API resale을 하나의 MaaS 구축 흐름으로 묶은 제품 포지셔닝이 확인된다.
원문 트윗 1개 보기

용어 해설

옴니 레퍼런스(Omni-Reference)
텍스트·이미지·오디오·비디오뿐 아니라 웹페이지와 문서까지 영상 생성 입력으로 활용하는 기능이다. 여러 형식의 자료를 한 번에 참조해 장면 구성과 시각적 일관성을 유지하는 데 쓰인다.
실사급 렌더링(Reality-Grade Rendering)
생성 영상의 질감과 움직임을 실제 장면에 가깝게 만드는 렌더링 방식이다. Wan3.0은 이를 최대 1080p 출력과 결합해 얼굴 표현과 현실적인 동작을 강화했다고 설명한다.
네이티브 30초 영상 생성(Native 30-Second Video Generation)
짧은 영상을 여러 조각으로 이어 붙이지 않고 한 번의 생성 과정에서 최대 30초 길이로 출력하는 방식이다. 영상 연결 과정 없이 한 장면의 동작과 조명을 유지하는 데 초점을 둔다.
100만 토큰 컨텍스트(1M-token Context)
모델이 한 입력 흐름에서 최대 100만 토큰 규모의 문맥을 처리하는 기능이다. Kimi-K3는 이를 repo-scale engineering과 자체 계획형 agents의 기반으로 내세우며 무료 체험을 제공한다.
Mixture-of-Experts
여러 전문가 네트워크 중 일부를 선택해 입력을 처리하는 모델 구조다. 100B 이상 규모의 MoE에서는 모델 크기와 학습 토큰 수에 따른 learning rate 조정 비용이 커져 proxy model 활용이 중요해진다.
하이퍼파라미터 전이(Hyperparameter Transfer)
작은 proxy model에서 찾은 최적 하이퍼파라미터를 더 큰 모델로 옮기는 방법이다. µP는 proxy run의 learning rate를 대규모 MoE에 전이하고 scaling law로 학습 토큰 증가에 따른 조정 폭을 예측한다.
Terminal-Bench
터미널 기반 agent 또는 harness의 성능을 평가하는 벤치마크다. Task-CoEvolve는 Terminal-Bench 2.1에서 후보 간 차이가 큰 검증 task를 우선 선택해 평가량을 줄이는 방식으로 사용했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 24.수집 2026. 08. 24.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.