본문으로 건너뛰기

NVIDIA Cosmos 3로 구축하는 Physical AI 모델 공장

NVIDIA Cosmos 3와 SageMaker HyperPod로 합성 데이터 생성부터 로봇 정책 평가까지 하나의 GPU 풀에서 순환시키는 Physical AI 모델 공장 구축법을 제시합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Physical AI는 한 번의 Fine-tuning으로 완성되지 않고 실제 데이터 수집, 합성 데이터 생성, 정책·인지 모델 학습, 폐루프 시뮬레이션 평가를 반복하는 모델 공장 구조를 필요로 합니다. NVIDIA Cosmos 3는 영상·이미지·행동·소리를 하나의 토큰 스트림으로 처리하고, 같은 Transformer trunk를 world model, action labeler, policy의 세 모드로 실행해 이 순환을 하나의 GPU 풀에서 운영하게 합니다. Amazon SageMaker HyperPod on Amazon EKS는 Amazon FSx for Lustre와 EFA를 공유하는 지속형 클러스터, 자동 복구, FSDP2·Context Parallelism 기반 분산 학습을 제공하며, 공개 DROID 데이터셋의 로봇 정책 학습과 Nano·Super 인지 Fine-tuning에 사용됩니다. 글의 비용 기준은 개별 작업의 최고 처리량이 아니라 예약된 GPU 시간당 전체 파이프라인 진척을 나타내는 GPU Goodput이며, Super 작업은 1~4노드에서 선형 대비 약 0.97~0.99의 강한 확장 효율을 기록했습니다.

섹션별 상세

01
Physical AI 시스템은 로봇이나 자율주행차가 현실 데이터를 행동으로 바꾸도록 만들어야 하므로 단일 학습 작업만으로 운영하기 어렵습니다. 실제 데이터를 수집·정제하고, 합성 데이터를 생성한 뒤, 인지·정책 모델을 재학습하고, 폐루프 시뮬레이션에서 실패 사례를 다시 데이터 생성 목표로 돌려보내는 순환이 필요합니다. 이 구조에서는 각 작업의 최고 처리량보다 예약된 GPU 시간에서 실제 파이프라인 진척이 차지하는 GPU Goodput이 비용과 운영 효율을 결정합니다.
Cosmos 3의 AR subsequence와 diffusion subsequence가 Reasoner와 Generator를 공유하는 구조를 나타낸 다이어그램입니다.
Diagram이미지는 비전·언어 토큰으로 구성된 AR 영역과 영상·오디오·행동 토큰으로 구성된 diffusion 영역이 하나의 멀티모달 attention을 통과하는 흐름을 나타냅니다. AR query는 causal attention으로 앞선 입력만 보고, diffusion query는 AR·diffusion key에 full attention을 적용해 생성 토큰을 Reasoner의 출력과 결합합니다. 글에서 설명한 per-layer joint attention과 단일 토큰 스트림의 구현 관계를 직접 확인할 수 있습니다.
Forward dynamics, inverse dynamics, policy 모드에서 깨끗한 토큰과 noise 토큰의 배치를 비교한 다이어그램입니다.
DiagramForward dynamics는 현재 영상과 행동을 깨끗한 토큰으로 유지하고 미래 영상을 noise에서 복원합니다. Inverse dynamics는 영상 전체를 유지하면서 행동을 복원하고, Policy는 첫 영상만 유지한 채 미래 영상과 행동을 생성합니다. 같은 모델 구조가 clean·noisy 토큰의 배치만 바꿔 합성 데이터 생성, 행동 라벨링, 정책 출력을 수행한다는 핵심을 압축해 나타냅니다.
02
NVIDIA Cosmos 3는 영상·이미지·행동·소리를 하나의 토큰 스트림으로 묶고, Reasoner와 Generator를 각 레이어의 attention으로 연결하는 Mixture-of-Transformers 구조를 사용합니다. Reasoner는 텍스트와 비전 입력을 인과적으로 처리하고 Generator는 영상·오디오·행동 토큰을 복원하므로, 생성 결과가 마지막 단계에서만 조건화되지 않고 각 레이어에서 추론 결과와 결합됩니다. 학습 중에는 전체 denoising과 영상 디코딩을 수행하지만 배포 시에는 소수의 denoising 단계만 거치고 행동 토큰만 디코딩해 로봇 관절 위치를 출력합니다.
실제 데이터 수집부터 합성 데이터 생성, 정책 post-training, 폐루프 평가까지 이어지는 Physical AI 모델 공장의 순환 구조입니다.
DiagramDROID·BridgeData2·자율주행 로그가 공통 코퍼스로 들어가고 Cosmos3-Super가 합성 데이터를 생성한 뒤 Cosmos3-Nano 정책 학습에 사용됩니다. 평가 단계에서 발견한 실패와 edge case는 새로운 생성 목표가 되어 데이터 코퍼스로 되돌아가며, 검증된 정책은 로봇이나 자율주행차에 배포됩니다. Amazon EKS와 SageMaker HyperPod가 네 단계를 연결하는 지속형 실행 기반으로 배치되어 있습니다.
03
Cosmos 3의 하나의 모델 계열은 토큰 중 어떤 부분을 깨끗한 값으로 두고 어떤 부분을 noise로 시작하느냐에 따라 세 가지 작업으로 바뀝니다. Forward dynamics에서는 현재 영상과 행동을 유지한 채 미래 영상을 생성해 희귀 주행·조작 장면을 합성하고, inverse dynamics에서는 영상을 유지한 채 두 장면 사이의 행동을 복원해 비라벨 영상에 행동 주석을 붙입니다. Policy 모드에서는 첫 영상과 proprioception을 조건으로 32개의 미래 관절 위치를 출력하며, Cosmos3-Nano는 약 16B, Cosmos3-Super는 약 64B, Cosmos3-Edge는 약 4B 파라미터 계열로 제공됩니다.
04
모델 공장은 DROID·BridgeData2·자율주행 센서 로그를 Amazon S3와 Amazon FSx for Lustre에 모은 뒤 Cosmos3-Super로 합성 데이터를 만들고, 결합된 데이터로 Cosmos3-Nano 정책을 post-train하는 네 단계 순환으로 구성됩니다. 정책 평가 서버는 같은 FSx 볼륨에서 새 checkpoint를 읽고 폐루프 시뮬레이션을 수행하므로 클러스터 사이의 테라바이트급 데이터 이동이나 재프로비저닝이 필요하지 않습니다. 평가에서 드러난 실패는 다음 합성 데이터 생성 목표가 되어 다시 학습 코퍼스에 들어갑니다.
05
Amazon SageMaker HyperPod on Amazon EKS는 생성·학습·평가를 하나의 지속형 GPU 노드 풀에서 Kubernetes workload로 실행하고, FSx for Lustre와 EFA를 공통 인프라로 연결합니다. 생성은 vLLM-Omni 서버, post-training은 cosmos-framework와 torchrun 기반 FSDP2·Ulysses Context Parallelism, 평가는 단일 GPU 정책 서버에서 실행되며 모두 같은 스토리지 경로를 사용합니다. HyperPod의 노드 상태 점검과 자동 복구, PyTorch Distributed Checkpoint 기반 재개는 장애가 발생해도 마지막 checkpoint 이후 작업만 다시 수행하도록 제한합니다.
cosmos-framework 학습 작업의 loss, step time, TFLOPS, MFU, 처리량, gradient norm, token 길이를 보여주는 모니터링 대시보드입니다.
Screenshot대시보드는 약 1.69K iteration 동안 training loss와 step time, GPU당 달성 TFLOPS, Model FLOPs Utilization, iteration throughput을 함께 추적합니다. Sequence packing 패널은 full length와 causal·image token 길이를 분리해 긴 멀티모달 입력 구성을 확인하게 하며, tokens per step은 약 40K~43K 범위의 변동을 나타냅니다. 학습 loss만이 아니라 계산 효율과 시퀀스 구성을 함께 측정해야 GPU Goodput을 평가할 수 있다는 글의 운영 관점과 연결됩니다.
HyperPod 관측성 확장에서 GPU 활성 상태, GPU utilization, HBM 사용량, GPU power를 GPU별로 추적하는 대시보드입니다.
Screenshot대시보드는 두 GPU의 graphics-engine-active와 GPU utilization을 시간축으로 비교하고, HBM 사용량과 GPU power도 함께 기록합니다. 한 GPU는 약 99.9% 활성 상태인 반면 다른 GPU는 0%로 표시되어 노드별 자원 사용 편차를 확인할 수 있습니다. 이런 인프라 지표는 cosmos-framework의 학습 지표와 결합해 실제 GPU가 작업을 수행하는지, 유휴 시간이나 불균형이 Goodput을 낮추는지 판단하는 데 사용됩니다.
06
실행 환경에서는 p5en.48xlarge 노드당 NVIDIA H200 GPU 8개를 사용하고, 다중 노드 통신이 EFA와 GPUDirect RDMA를 실제로 선택했는지 NCCL 로그와 all_reduce_perf로 검증해야 합니다. cosmos-framework가 고정한 torch 2.10.0+cu130 및 CPython 3.13 조건과 AWS Deep Learning Containers의 NCCL·aws-ofi-nccl 조합이 맞지 않으면 EFA가 TCP로 대체되거나 초기화에 실패할 수 있습니다. 글의 실험은 DROID 로봇 정책, Cosmos3-Nano 영상 SFT, Cosmos3-Super 영상 LoRA를 실행했고 Super workload는 1~4노드에서 선형 대비 약 0.97~0.99의 확장 효율을 유지했습니다.
bash
kubectl delete pytorchjob cosmos3-droid-policy-hp
kubectl delete -f hyperpod-eks/serve-policy.yaml

학습이 끝난 뒤 Cosmos 3 정책 학습 작업과 정책 서빙 Deployment를 삭제합니다.

bash
aws fsx delete-file-system --file-system-id

Amazon FSx for Lustre 파일 시스템을 삭제하는 명령의 시작 부분으로, 실제 파일 시스템 ID를 지정해야 합니다.

용어 해설

Physical AI
Physical AI는 로봇이나 자율주행차처럼 현실 세계의 영상·이미지·행동·소리를 입력으로 받아 물리적 행동을 출력하는 인공지능입니다. 데이터 수집, 합성 데이터 생성, 정책 학습, 폐루프 평가를 반복하며 실제 환경에 대응하는 모델을 개선합니다.
모델 공장(Model Factory)
모델 공장은 실제 데이터를 지속적으로 수집하고 합성 데이터로 보강한 뒤, 정책·인지 모델을 재학습하고 시뮬레이션에서 평가하는 운영 파이프라인입니다. 단일 학습 작업이 아니라 여러 단계가 같은 컴퓨팅·스토리지 자원을 순환하는 구조입니다.
Mixture-of-Transformers
Mixture-of-Transformers는 하나의 Transformer 계열 구조 안에서 서로 다른 전문가가 역할을 나누는 설계입니다. Cosmos 3에서는 Reasoner가 다음 토큰을 예측하고 Generator가 영상·오디오·행동 토큰을 복원하며, 두 경로가 각 레이어의 attention으로 연결됩니다.
Context Parallelism
Context Parallelism은 긴 입력 시퀀스를 여러 GPU에 분할해 처리하는 분산 학습 방식입니다. Cosmos 3처럼 영상 latent, 텍스트, 행동 토큰이 수만 개까지 이어지는 작업에서 FSDP2와 함께 여러 노드의 메모리와 연산을 나눠 사용합니다.
GPU Goodput
GPU Goodput은 예약한 GPU 시간 전체에서 실제 파이프라인 진척으로 이어진 유용한 작업량을 뜻합니다. 이 글에서는 단일 작업의 최고 처리량보다 데이터 이동과 노드 재프로비저닝 손실을 포함한 전체 순환 작업의 효율을 비용 기준으로 삼습니다.

기술

  • NVIDIA Cosmos 3
  • Amazon SageMaker HyperPod
  • Amazon EKS
  • Amazon S3
  • Amazon FSx for Lustre
  • Elastic Fabric Adapter
  • EFA
  • NCCL
  • vLLM-Omni
  • cosmos-framework
  • torchrun
  • FSDP2
  • Ulysses context parallelism
  • Kubeflow PyTorchJob
  • PyTorch Distributed Checkpoint
  • AWS Deep Learning Containers
  • Amazon Elastic Container Registry
  • DROID
  • BridgeData2
  • LeRobot v3
  • Cosmos3-Nano
  • Cosmos3-Super
  • Cosmos3-Edge
  • LoRA

활용 사례

  • 로봇 조작 정책 학습
  • 자율주행 장면 합성
  • 비라벨 로봇 영상의 행동 라벨링
  • 로봇 정책의 폐루프 시뮬레이션 평가
  • Physical AI 모델의 지속적 데이터 생성과 재학습
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 05.수집 2026. 09. 05.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.