본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/Cosmos3-Edge

옴니모달 월드 모델 — 물리 AI(로보틱스·자율주행·스마트 스페이스)용 영상·이미지·행동 생성 및 추론4B (Cosmos3-Edge)Reasoner 경로 최대 256K 토큰 컨텍스트OpenMDW1.1

NVIDIA의 4B 옴니모달 월드 모델로 텍스트·이미지·비디오·행동 궤적을 함께 입력받아 로보틱스·자율주행용 비디오·이미지·행동 명령을 생성한다.

학습 방식 · 자기회귀 트랜스포머와 확산 트랜스포머를 결합한 Mixture-of-Transformers를 로보틱스·자율주행·산업 현장 등에서 수집한 13억 데이터 포인트(393개 데이터셋)로 학습했고, 해시 매칭·분류기 기반 다층 안전 필터링을 거쳤다.

TL;DR

Cosmos3-Edge는 NVIDIA Cosmos3 패밀리의 4B 파라미터 경량 버전으로, 자기회귀 트랜스포머와 확산 트랜스포머 두 개 타워를 결합한 Mixture-of-Transformers 구조로 텍스트는 다음 토큰 예측으로, 이미지·비디오·행동은 반복적 디노이징으로 생성하는 이질적 모달리티를 한 프레임워크에서 다룬다. 텍스트·이미지·비디오·행동 궤적을 조합 입력받아 256p/480p 해상도의 비디오·이미지와 카메라·로봇팔·자율주행차 등 여러 embodiment의 행동 명령을 함께 출력할 수 있고, 별도의 Reasoner 입력 경로로 256K 토큰까지의 텍스트·이미지·비디오를 받아 체인오브소트 추론과 2D/3D 위치 추정도 수행한다. 학습 데이터는 13억 개 데이터 포인트, 393개 데이터셋으로 구성되며 CSAM·NCII 등 유해 콘텐츠에 대한 해시 매칭·분류기 기반 다층 필터링을 거쳤다. vLLM-Omni·vLLM·PyTorch로 서빙할 수 있고 Ampere부터 Blackwell까지 지원하지만 BF16만 정식 테스트됐다.

핵심 포인트

  • 자기회귀 트랜스포머(텍스트)와 확산 트랜스포머(이미지·비디오·행동)를 한 프레임워크에 결합한 Mixture-of-Transformers 구조다.
  • 카메라 모션·자율주행차·듀얼 프랑카 암·UR·구글 로봇 등 다양한 embodiment의 행동 궤적을 조건으로 받거나 생성할 수 있다.
  • 생성 경로와 별도로 256K 토큰 Reasoner 입력 경로를 둬 체인오브소트 추론과 2D/3D 위치·바운딩박스 추정을 지원한다.
  • 07/20 릴리스에 DMD2 4스텝 증류판을 추가해 이미지·비디오 고속 생성 옵션을 넓혔다.

제한사항

  • BF16만 정식 테스트됐고 FP4·FP8·FP16 등 다른 정밀도는 공식 지원되지 않는다.
  • Linux 외 운영체제에서는 테스트되지 않았다.
  • 대규모 필터링에도 유해 콘텐츠 잔존 위험이 남아 있어 배포 후에도 지속적인 모니터링과 데이터셋 재검토가 필요하다고 명시한다.

142

LIKES

35.1k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.