TL;DR
비디오 월드 모델을 백본으로 쓰는 World Action Models(WAMs)는 장면의 시간적 거동을 학습해 물리적 일반화와 데이터 효율을 개선한다. NVIDIA의 Cosmos 3은 MoT 아키텍처와 대규모 멀티모달·액션 데이터(약 7.67억 이미지, 3.48억 비디오, 800만 액션)를 기반으로 WAM 포스트 트레이닝에 적합한 사전지식을 제공한다. 같은 학습 레시피에서 omni 초기화는 RoboLab 성공률을 28.1%에서 36.8%로 끌어올렸고, 4B·16B 모델은 Jetson·워크스테이션 계층에서 실시간 제어와 서버 서빙을 모두 지원하므로 실제 로봇 적용에서 빠른 적응 경로를 제시한다.
빠른 이해
새로운 점
비디오 기반 월드 모델로 행동과 미래 프레임을 공동 예측해 제로샷 전이를 가능하게 하는 점
핵심 메커니즘
Cosmos 3의 MoT 아키텍처는 이산 텍스트와 연속 모달리티를 각기 다른 생성 메커니즘으로 처리한다. 입력으로 비디오·텍스트·로봇 상태가 주어지면 autoregressive transformer가 언어적 추론을 이끌어 이산 토큰을 생성하고, diffusion transformer는 연속 신호(이미지·비디오·행동)를 다단계 denoising 과정으로 복원해 행동 청크를 산출한다. 이 과정에서 정책은 동일한 모델에서 행동을 생성함과 동시에 그 행동을 실행했을 때의 미래 장면을 예측함으로써 계획-예측 루프를 통합하고, 그 결과로 적은 태스크별 데이터로도 새로운 로봇·장면에 빠르게 적응할 수 있는 물리적 프라이어를 제공한다.
핵심 수치
- RoboLab 성공률: 28.1% → 36.8%- 동일 레시피에서 omni 체크포인트로 초기화한 정책의 성능 향상 수치, 논문/기술보고서 비교 결과
- 학습 데이터 규모: 767M 이미지, 348M 비디오, 8M 액션 샘플- Cosmos 3에 사용된 멀티도메인 물리 데이터 통계
- 모델 크기 라인업: 4B (Edge) / 16B (Nano) / 64B (Super)- 배포 계층별로 제공되는 Cosmos 3 모델 스케일
- 엣지 실시간 제어: 15 Hz, 32 actions/추론- Cosmos3-Edge가 Jetson Thor에서 보고한 제어 빈도와 액션 청크 크기
- 지원 하드웨어: Jetson T2000/T3000, Jetson Thor, RTX PRO 6000, DGX, GeForce RTX- 워크스테이션·엣지·서버 배포용으로 명시된 플랫폼
섹션별 상세
문제와 한계
WAM의 작동 원리와 장점

Cosmos 3 아키텍처와 데이터
- Cosmos 3의 학습 데이터 규모는 약 767M 이미지, 348M 비디오, 8M 액션 샘플이다. — 본문의 Cosmos 3 데이터 통계(숫자 나열) 부분과 기술보고서 표/단락을 확인하면 됨.
정책 특화 사례와 증거


- Omni로 사전학습된 체크포인트가 RoboLab 성공률을 28.1%에서 36.8%로 향상시켰다. — 본문의 Cosmos 3 기술보고서 비교 실험 결과 문단과 Figure 1–2 근처 기술 서술 참조.
배포 계층과 성능 지표
- Cosmos 3 Edge(4B)는 Jetson Thor에서 640×360 관찰로 32개 액션을 생성하며 실시간 제어 15Hz를 달성했다. — 배포 고려 섹션의 성능·하드웨어 문장과 구체적 수치 표기 확인.
개발자 착수 경로
용어 해설
- 비디오 월드 모델(Video world model)
- — 시간축 상의 영상 변화를 입력으로 받아 미래 프레임과 관련 상태를 예측하는 모델로, 장면 동학을 학습해 물체의 이동·충돌·변형 같은 물리적 거동을 모델링한다. 입력으로 연속 프레임과 텍스트를 받고 출력으로 연속 영상과 행동 시퀀스를 생성할 수 있어 로봇 정책의 물리 일반화를 돕는다.
- 비전-언어-액션(VLA)(Vision-Language-Action (VLA))
- — 사전학습된 VLM(backbone)을 기반으로 장면 이해와 명령 해석을 거쳐 별도 액션 헤드가 관절 명령을 생성하는 패러다임으로, 시맨틱 일반화에는 강하지만 장면 동학을 직접 모델링하지 못해 물리적 일반화에 한계가 있다.
- Mixture-of-Transformers(MoT)(Mixture-of-Transformers (MoT))
- — 여러 Transformer 구성요소를 조합해 각 모달리티별로 적합한 생성 메커니즘을 쓰는 아키텍처로, Cosmos 3에서는 autoregressive transformer가 이산 텍스트 토큰을, diffusion transformer가 연속적 영상·행동을 처리하는 구조를 채택한다.
- 디퓨전 트랜스포머(Diffusion transformer)
- — 연속 신호(이미지·비디오·연속 행동)를 반복적 노이즈 제거 방식으로 생성하는 모듈로, 초기 노이즈 상태에서 여러 단계의 denoising 과정을 거쳐 실제와 유사한 연속 출력을 만든다. 행동 생성 시 한 번에 정규화된 액션 청크를 복원하는 용도로 사용된다.
- 포스트 트레이닝(Post-training)
- — 사전학습된 대형 모델을 특정 다운스트림 작업(로봇 플랫폼·데이터셋)에 맞춰 추가 학습하는 과정으로, 이미 학습된 물리·멀티모달 사전지식을 유지한 채 정책 출력을 특화시키므로 적은 태스크별 데이터로도 빠르게 적응할 수 있다.
기술
- Cosmos 3
- Mixture-of-Transformers
- diffusion transformer
- Jetson Thor
- RTX PRO 6000
- LeRobotDataset
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.