이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
Cosmos-Predict2.5는 비디오 파운데이션 모델을 통해 미래 관측을 예측하여 물리 AI 학습을 위한 데이터를 생성하고 정책을 평가하는 월드 모델이다. 데이터 큐레이션, 다단계 학습, 모델 머징 등 체계적인 학습 파이프라인을 통해 성능을 확보했다.
배경
물리 AI 에이전트가 실제 환경에서 학습하는 것은 비용이 많이 들고 위험하므로, 이를 대체할 시뮬레이션 환경이 필요하다.
대상 독자
물리 AI, 로봇 공학, 비디오 생성 모델 연구자 및 개발자.
의미 / 영향
Cosmos-Predict2.5는 로봇 학습을 위한 시뮬레이션 데이터 생성의 패러다임을 바꿀 수 있다. 실제 환경에서의 데이터 수집 한계를 극복하고, 물리 AI의 일반화 성능을 높이는 데 기여할 것이다.
챕터별 상세
00:00
배경 및 월드 모델의 필요성
물리 AI 에이전트가 실제 환경에서 센서와 액추에이터를 통해 학습하는 것은 비용이 높고 위험하다. 따라서 에이전트가 보게 될 미래의 관측을 가상으로 생성하는 월드 모델이 필요하다. 기존의 물리 엔진 기반 시뮬레이터는 정해진 수식에 의존하여 일반화와 확장이 어렵지만, 딥러닝 기반의 월드 모델은 데이터 기반으로 학습하여 이러한 한계를 극복한다.
06:15
Cosmos-Predict2.5 개요
Cosmos-Predict2.5는 NVIDIA에서 발표한 월드 파운데이션 모델이다. 이 모델은 Text2World, Image2World, Video2World 태스크를 하나의 모델로 수행한다. 예측 대상이 세계(World) 자체이기 때문에 월드 파운데이션 모델이라는 용어를 사용한다.
07:25
데이터 큐레이션 및 전처리
다양한 실세계 도메인(로보틱스, 주행, 인간 동작 등)의 데이터를 수집하고 필터링 과정을 거친다. Aesthetic Quality Filter, Motion Filter, OCR Detection, VLM Filter 등을 사용하여 고품질 데이터만 선별한다. 비디오 캡셔닝과 중복 제거를 통해 학습 데이터셋을 구축한다.
09:05
방법론: Flow Matching과 DiT
기존 확산 모델의 학습 방식을 개선하기 위해 Flow Matching을 도입했다. 이는 노이즈에서 데이터로 가는 경로를 직선으로 정의하여 생성 속도와 효율을 높인다. 또한, 디퓨전 트랜스포머(DiT) 아키텍처를 사용하여 확장성을 확보했다.
12:05
모델 아키텍처 및 학습
Visual Tokenizer로 WAN2.1 VAE를 사용하여 비디오를 압축하고, 패치화(patchification)를 통해 잠재 피처를 생성한다. 텍스트 인코더로는 Cosmos-Reason1을 사용하며, 트랜스포머 블록의 출력을 모두 컨캣(concat)하여 로컬 및 글로벌 컨텍스트를 포착한다. 학습은 해상도와 태스크 다양성을 점진적으로 높이는 다단계 커리큘럼 학습을 적용한다.
15:48
파인튜닝 및 강화학습
도메인별 데이터셋으로 지도 미세 조정(SFT)을 수행한 후, 모델 머징(Model Merging) 기법을 통해 범용 성능을 유지하면서 도메인별 성능을 최적화한다. 또한, VideoAlign을 리워드 모델로 사용하고 GRPO 방식을 적용하여 인간 선호도에 맞춘 강화학습을 수행한다.
16:55
평가 및 활용 사례
PAI-Bench를 통해 모델 성능을 평가한 결과, Cosmos-Predict2.5는 대규모 모델과 유사한 성능을 보인다. Cosmos-Transfer2.5를 통해 다양한 공간 제어 입력을 조건으로 받아 제어 가능한 시뮬레이션을 수행한다. 또한, 로봇의 액션 정보를 조건으로 입력하여 액션에 따른 미래 비디오를 생성하는 기능을 확인했다.
용어 해설
- Flow Matching
- — 노이즈 분포에서 데이터 분포로 가는 경로를 확률 미분 방정식 대신 직선으로 정의하여 생성 모델링의 효율성을 높이는 기법이다. 기존 확산 모델보다 적은 스텝으로 고품질 생성이 가능하다.
- Latent Diffusion Model
- — 고해상도 픽셀 공간이 아닌, VAE 등을 통해 압축된 잠재 공간(Latent Space)에서 확산 과정을 수행하는 모델이다. 계산 복잡도를 획기적으로 줄여 고해상도 이미지 및 비디오 생성에 널리 사용된다.
- Diffusion Transformer
- — 확산 모델의 노이즈 예측 네트워크로 트랜스포머 아키텍처를 사용하는 모델이다. 기존 U-Net 구조보다 확장성이 뛰어나 대규모 모델 학습에 유리하다.
- Physical AI
- — 로봇 등 물리적 에이전트가 센서와 액추에이터를 통해 실제 세계와 상호작용하며 작업을 수행하는 AI이다. 실제 환경에서의 데이터 수집이 어렵고 위험하다는 특징이 있다.
- Model Merging
- — 서로 다른 데이터셋으로 학습된 모델의 가중치를 결합하여, 개별 모델의 성능을 유지하면서도 다중 도메인에 대한 범용적인 성능을 확보하는 기법이다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 15.수집 2026. 06. 15.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
