nvidia/Alpamayo2-Super
Cosmos3‑Super 기반의 32B VLM 백본과 2.3B diffusion 액션 익스퍼트를 결합한 Alpamayo 2 Super
학습 방식 · 대규모 멀티모달 센서 데이터로 사전학습된 Cosmos3‑Super 기반을 출발점으로 하여, VLM 백본과 diffusion 기반의 액션 디코더를 결합해 파인튜닝을 진행했습니다. 데이터 입력으로는 RGB 카메라 영상, IMU/GPS 기반의 egomotion 타임스탬프 시퀀스, 그리고 구조화된 Chain‑of‑Causation 추론 텍스트를 사용했고 자동 수집 데이터와 사람이 검수한 라벨을 혼합해 학습 안정성과 안전 관련 신호를 보강했습니다. 학습 스케일은 이미지 10억장 이상, 115,000시간 규모의 다중 카메라 주행 비디오, 3.7M CoC 트레이스로 구성되어 모델이 장기 추론과 행동 생성 양쪽을 동시에 학습하도록 구성되었습니다.
TL;DR
Alpamayo 2 Super는 nvidia/Cosmos3‑Super를 기반으로 한 34B 규모의 파운데이션 VLA 모델로, 32B VLM 백본과 약 2.3B 규모의 diffusion 액션 익스퍼트를 결합해 perception에서 궤적 생성까지 통합 처리하도록 설계되어 있습니다. 학습에는 대규모 멀티카메라 주행 비디오와 3.7M개의 Chain‑of‑Causation 추론 트레이스를 포함한 하이브리드 라벨 데이터가 사용되었고, 출력은 가변 길이의 원인‑추론 텍스트와 0.1초 간격으로 구성된 64개 웨이포인트 궤적(0.1–6.4s)을 제공합니다. H100 80GB 환경에서 평가와 프로파일링이 수행되었으며 LingoQA 79.2, AlpaSim 1.50 ± 0.13, minADE_6(6.4s) 0.911m 등의 지표로 AV 관련 인식·추론·경로 예측 과제에서 실용적 성능을 보입니다.
핵심 포인트
- Alpamayo 2 Super는 nvidia/Cosmos3-Super를 기반으로 한 34B 규모의 멀티모달 파운데이션 모델로, 32B VLM 백본과 약 2.3B 규모의 diffusion 기반 액션 익스퍼트를 결합해 Vision‑Language‑Action 처리를 하나의 아키텍처로 통합합니다. 입력으로 다중 카메라의 동기화된 복수 프레임 영상, 텍스트 지시, 그리고 시간축을 가진 egomotion 히스토리를 받아들이며, 출력으로는 Chain‑of‑Causation 형태의 추론 텍스트와 64개 웨이포인트로 구성된 연속 궤적을 반환합니다. 이러한 설계는 perception에서 계획·행동 생성까지 연속적인 AV 파이프라인을 단일 모델로 처리하려는 목적을 갖습니다.
- 학습 데이터는 센서 기반의 대규모 멀티모달 콜렉션을 사용하며 이미지 데이터가 10억 장 이상, 텍스트 토큰은 10억 미만, 비디오 수십만 시간 수준의 규모를 포함합니다. 학습 과정에서는 자동 수집된 센서 데이터와 수동 어노테이션을 혼합한 하이브리드 라벨링을 활용했고 약 3.7백만 개의 Chain‑of‑Causation(reasoning) 트레이스를 포함해 원인 기반 의사결정 흔적을 모델에 공급했습니다. 이로 인해 모델은 단순한 인식뿐 아니라 원인·결과 연결을 고려한 추론적 응답과 장기 궤적 예측이 가능하도록 설계되었습니다.
- 실사용을 겨냥한 인퍼런스 최적화와 검증이 H100 80GB HBM3 환경에서 수행되었고, 평가 시 일곱 카메라·카메라당 네 프레임 구성, BF16, Diffusion 10스텝, classifier‑free guidance 비활성화 설정으로 피크 장치 메모리 약 72,115 MiB를 기록했습니다. 공개 노트북 프로파일은 여섯 카메라·네 프레임 구성을 권장 프로세서에 맡겨 이미지 리사이즈와 정규화를 처리하도록 설계되어 있어 입력 전처리 계약이 모델 패키지의 프로세서로 관리됩니다. 이러한 구현은 대형 AV 모델의 메모리·연산 제약을 실무적으로 보여주며 GPU 아키텍처(H100)에 대한 검증 중심 배포를 전제로 합니다.
- 정량적 평가에서 LingoQA Lingo‑Judge 79.2 점으로 고난도 추론 과제에서 상위권 성능을 보였고, AlpaSim 폐쇄 루프 테스트에서 1.50 ± 0.13의 점수를 기록했으며 열린 루프 경로 예측 지표인 minADE_6(6.4s)에서는 0.911m를 달성했습니다. 멀티태스크 벤치마크 차트는 meta‑action IoU, auto‑labeling, 2D grounding 등 여러 항목에서 Alpamayo 2 Super가 비교 모델 대비 우위에 있는 모습을 시각화하고 있습니다. 이 수치들은 모델이 인식·추론·궤적 예측을 통합하는 목적에 맞춘 트레이닝과 아키텍처 설계의 실효성을 반영합니다.
제한사항
- 모델은 대규모 GPU 자원이 전제인 아키텍처이며 공개 프로파일에서 검증된 실행 환경은 NVIDIA H100 80GB HBM3 한 종에 국한되어 있으므로 다른 GPU 마이크로아키텍처에서의 메모리·성능 이식성은 별도 검증이 필요합니다. 측정된 피크 장치 메모리(약 72,115 MiB)와 PyTorch 할당치를 고려하면 엣지나 경량화 환경에서 바로 운용하기 어렵고 추가적인 최적화(quantization, sharding, LoRA 등)가 요구됩니다.
- 데이터와 어노테이션은 자율주행 도메인 특화로 구성되어 있어 다른 비구조적 비주얼 리치 태스크나 도메인(예: 실내 로봇, 산업용 로봇)으로 바로 일반화하기 어렵습니다. 배포 전에는 목표 운영 환경의 센서 구성·타임스텝·레이블 분포에 맞춘 추가 튜닝과 안전성 검증이 권장됩니다.
- 모델 출력에는 Chain‑of‑Causation 텍스트와 연속 궤적이 포함되나 실제 차량 제어로의 직접 연결 시에는 시스템 레벨의 안전 검사·검증 프로세스가 필요합니다. README에서 안전·윤리 고려사항과 V‑model 기반 검증 절차를 권장하고 있으므로 규제 준수와 내부 검증 절차를 병행해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| LingoQA | Lingo‑Judge Score | 79.2 | — |
| AlpaSim Closed‑Loop | AlpaSim Score | 1.50 ± 0.13 | — |
| PhysicalAI‑AV Open‑Loop | minADE_6 (6.4s) | 0.911 m | — |
이미지 분석


69
Likes
45
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.