옴니모달 물리적 AI 추론·생성 플랫폼, Cosmos3-Edge 4B
Cosmos3-Edge는 텍스트·이미지·비디오·행동 궤적을 입력으로 받아 이미지·비디오·행동·텍스트를 생성하고 장기 컨텍스트 추론을 지원하는 4B 옴니모달 모델이다.
TL;DR
Cosmos3-Edge는 NVIDIA가 발표한 4B 파라미터 규모의 옴니모달 모델로서 텍스트·이미지·비디오·행동 궤적을 입력으로 받아 텍스트·이미지·비디오·행동 출력을 생성하고 최대 256K 토큰의 긴 컨텍스트 추론을 지원한다. 아키텍처는 autoregressive 텍스트 탑과 diffusion 기반 연속 모달 탑을 병렬로 조합한 Mixture-of-Transformers 구조를 사용해 모달별로 최적화된 생성 경로를 유지하며 DMD2 증류를 통해 4단계 이미지→비디오 생성 같은 저단계 고품질 워크플로를 실현한다. 훈련에는 1.3B 데이터 포인트와 393개 데이터셋 항목이 사용되었고 BF16 환경에서 검증되었으며 엣지·데이터센터 모두를 대상으로 vLLM·PyTorch 벤치마크와 Jetson 임베디드 성능 수치가 제공된다. 단점으로는 물리적 정확성을 보장하는 명시적 시뮬레이터가 없어 장기 물리 시뮬레이션에서 물체 소실·비현실적 충돌·행동 드리프트 같은 생성 아티팩트가 발생할 수 있으며 안전·임무 크리티컬 배포를 위해 추가 검증과 제약이 필요하다.
핵심 역량
- 텍스트 프롬프트와 이미지 또는 비디오를 결합해 자연어 추론·계획을 생성하며 2D/3D 좌표와 바운딩 박스 등 구조화된 출력을 포함할 수 있다.
- 단일 이미지 또는 여럿의 이미지와 프롬프트로부터 일관된 시간적 흐름의 비디오를 256p/480p 해상도에서 생성하며 프레임 수·fps·샘플러·시드 등 생성 파라미터를 제어할 수 있다.
- 행동 궤적(행렬 형태, (T, D))을 입력으로 받아 forward/inverse dynamics 롤아웃을 수행하거나 언어 지시로부터 로봇 행동 궤적을 출력하는 정책 초기화 용도로 사용될 수 있다.
- Reasoner는 최대 256K 토큰의 긴 컨텍스트를 처리하며 체인-오브-사고 스타일의 내부 사고 표현을 포함하는 텍스트 출력을 생성할 수 있다.
- 임베디드·데이터센터·엣지 플랫폼 모두에서 동작하도록 vLLM·PyTorch 런타임과 Jetson 계열을 포함한 여러 하드웨어 벤치마크를 제공한다.
강점
- 엣지급 4B 모델로 설계되어 단일 GPU에서도 추론이 가능하며 480p 이미지→비디오 워크플로에서 동급 대비 높은 처리량을 기록해 실용적 생성 파이프라인에 유리하다.
- 오토리그레시브 텍스트 탑과 diffusion 기반 생성 탑을 분리한 MoT 구성으로 텍스트와 연속 신호(이미지·비디오·오디오·행동)를 모달 특성에 맞춰 최적으로 처리할 수 있다.
- 행동 궤적 입력을 도메인별 D차원 형식으로 직접 수용해 forward/inverse dynamics 및 정책 초기화에 바로 활용 가능한 출력 형태를 제공하므로 로봇·자율주행 연구 파이프라인 연계가 용이하다.
훈련 방식
Cosmos3는 Cosmos Framework 기반에서 다중 모달리티를 동시에 학습하기 위해 autoregressive 텍스트 손실과 diffusion 기반 연속 모달 손실을 조합해 학습했으며, 2024–2026년에 수집한 1.3B 포인트 규모의 혼합(센서·합성·자동 수집) 데이터로 사전학습·정제·증류를 수행했다.
알아두면 좋은 것
- 모델은 Mixture-of-Transformers 아키텍처를 사용해 autoregressive 텍스트 생성 탑과 diffusion 기반 연속 모달 생성 탑을 병렬로 구성함으로써 모달별 생성 메커니즘을 분리했다.
- 훈련에 사용된 전체 코퍼스는 1.3B 데이터 포인트, 393개 데이터셋 항목으로 멀티모달(이미지·비디오·액션·텍스트) 소스가 결합되어 있으며 합성 데이터와 시뮬레이션 데이터가 보강에 활용되었다.
- Image-to-Video 평가는 480p, 24 fps 조건에서 이루어졌고 Cosmos3-Edge는 동급에서 높은 생성 처리량(throughput)을 제공하는 것으로 보고되었다.
- 공식적으로 BF16 정밀도 환경에서 테스트되었으며 다른 정밀도(FP16/FP8/FP4)는 공식 지원 대상이 아니다.
기술적 특징
- Mixture-of-Transformers 아키텍처는 텍스트에 대해 autoregressive decoding을, 비텍스트 연속 모달에 대해 반복적 denoising(diffusion) 생성을 각각 수행하도록 두 개의 Transformer 탑을 병렬로 배치했다. 이 설계는 각 모달에 적합한 생성 메커니즘을 유지하면서 단일 모델로 옴니모달 동작을 가능하게 한다.
- Action trajectory 처리 파이프라인은 프레임당 embodiment별 차원(D)을 갖는 (T, D) 형태의 JSON 액션 시퀀스를 입력으로 받고 forward/inverse dynamics 작업에서 청크 단위로 롤아웃을 수행해 메모리·연산을 분할한다. 마지막 생성 프레임을 다음 청크의 조건 이미지로 넣는 autoregressive conditioning을 적용해 장기 롤아웃을 안정적으로 합성한다.
- 이미지→비디오 4단계 모델에는 Improved Distribution Matching Distillation(DMD2)을 적용해 교사 모델의 분포를 학생 모델이 적은 샘플 수로 근사하도록 하여 4단계로도 고품질 시퀀스 생성을 달성했다. 이 접근은 실시간성·처리량을 중시하는 엣지/서빙 환경에서 유의미한 이득을 만든다.
- Reasoner는 최대 256K 토큰의 컨텍스트를 지원하며 내부적으로 체인-오브-사고 스타일의 구조화된 출력을 허용하고 2D/3D 위치나 바운딩 박스 같은 정량적 시각 정보를 텍스트와 함께 산출할 수 있다. 긴 문맥 처리와 구조화된 추론 출력을 결합해 물리적 장면 이해·계획 수립에 적합하다.
- 하드웨어 최적화 관점에서 BF16 기반으로 검증되었고 vLLM·PyTorch 런타임 벤치마크와 Jetson 임베디드 보드까지 포함한 단일 GPU/엣지 플랫폼 성능표를 제공해 배포·성능 예측이 용이하다.
차별점
- Cosmos3-Edge는 autoregressive 텍스트 탑과 diffusion 기반 생성 탑을 결합한 Mixture-of-Transformers 구조로 모달별 생성 메커니즘을 분리해 텍스트·연속 모달을 동시에 최적화했다. 이 구조는 텍스트와 영상·행동을 같은 모델에서 자연스럽게 연결할 수 있게 해주며 single-checkpoint로 다양한 태스크를 처리한다.
- Action trajectory를 도메인별 차원(D)으로 명시적으로 지원해 여러 로봇·AV·카메라 모션 포맷(예: 9D, 10D, 20D, 57D 등)을 그대로 입력·출력으로 사용한다. 이로 인해 별도 변환 없이 직접 제어 궤적 생성·예측 파이프라인에 연결할 수 있다.
- Image-to-Video 용량과 단계 수를 줄이는 데 DMD2 기반 증류를 적용해 4단계 생성으로도 높은 품질을 유지하면서 엣지·서빙 환경에서 실용적 처리량을 확보했다. 결과적으로 단일 GPU에서 실용적 생성 처리량을 얻는 엔지니어 편의성이 향상되었다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Image-to-Video (PyTorch, H100 SXM 80 GB) | generation latency (s) | 23.92 | — |
| Image-to-Video (vLLM, H100 SXM 80 GB) | generation latency (s) | 27.64 | — |
| Reasoner Time To First Token (vLLM, RTX PRO 6000, 50/1/1) | time to first token (ms) | 141.99 | — |
| Training corpus size | data points | 1.3B | — |
이미지 분석



142
Likes
35.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.