nvidia/Cosmos3-Edge
NVIDIA의 4B 옴니모달 월드 모델로 텍스트·이미지·비디오·행동 궤적을 함께 입력받아 로보틱스·자율주행용 비디오·이미지·행동 명령을 생성한다.
학습 방식 · 자기회귀 트랜스포머와 확산 트랜스포머를 결합한 Mixture-of-Transformers를 로보틱스·자율주행·산업 현장 등에서 수집한 13억 데이터 포인트(393개 데이터셋)로 학습했고, 해시 매칭·분류기 기반 다층 안전 필터링을 거쳤다.
TL;DR
Cosmos3-Edge는 NVIDIA Cosmos3 패밀리의 4B 파라미터 경량 버전으로, 자기회귀 트랜스포머와 확산 트랜스포머 두 개 타워를 결합한 Mixture-of-Transformers 구조로 텍스트는 다음 토큰 예측으로, 이미지·비디오·행동은 반복적 디노이징으로 생성하는 이질적 모달리티를 한 프레임워크에서 다룬다. 텍스트·이미지·비디오·행동 궤적을 조합 입력받아 256p/480p 해상도의 비디오·이미지와 카메라·로봇팔·자율주행차 등 여러 embodiment의 행동 명령을 함께 출력할 수 있고, 별도의 Reasoner 입력 경로로 256K 토큰까지의 텍스트·이미지·비디오를 받아 체인오브소트 추론과 2D/3D 위치 추정도 수행한다. 학습 데이터는 13억 개 데이터 포인트, 393개 데이터셋으로 구성되며 CSAM·NCII 등 유해 콘텐츠에 대한 해시 매칭·분류기 기반 다층 필터링을 거쳤다. vLLM-Omni·vLLM·PyTorch로 서빙할 수 있고 Ampere부터 Blackwell까지 지원하지만 BF16만 정식 테스트됐다.
핵심 포인트
- 자기회귀 트랜스포머(텍스트)와 확산 트랜스포머(이미지·비디오·행동)를 한 프레임워크에 결합한 Mixture-of-Transformers 구조다.
- 카메라 모션·자율주행차·듀얼 프랑카 암·UR·구글 로봇 등 다양한 embodiment의 행동 궤적을 조건으로 받거나 생성할 수 있다.
- 생성 경로와 별도로 256K 토큰 Reasoner 입력 경로를 둬 체인오브소트 추론과 2D/3D 위치·바운딩박스 추정을 지원한다.
- 07/20 릴리스에 DMD2 4스텝 증류판을 추가해 이미지·비디오 고속 생성 옵션을 넓혔다.
제한사항
- BF16만 정식 테스트됐고 FP4·FP8·FP16 등 다른 정밀도는 공식 지원되지 않는다.
- Linux 외 운영체제에서는 테스트되지 않았다.
- 대규모 필터링에도 유해 콘텐츠 잔존 위험이 남아 있어 배포 후에도 지속적인 모니터링과 데이터셋 재검토가 필요하다고 명시한다.
142
LIKES
35.1k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.