TL;DR
Physical AI는 한 번의 Fine-tuning으로 완성되지 않고 실제 데이터 수집, 합성 데이터 생성, 정책·인지 모델 학습, 폐루프 시뮬레이션 평가를 반복하는 모델 공장 구조를 필요로 합니다. NVIDIA Cosmos 3는 영상·이미지·행동·소리를 하나의 토큰 스트림으로 처리하고, 같은 Transformer trunk를 world model, action labeler, policy의 세 모드로 실행해 이 순환을 하나의 GPU 풀에서 운영하게 합니다. Amazon SageMaker HyperPod on Amazon EKS는 Amazon FSx for Lustre와 EFA를 공유하는 지속형 클러스터, 자동 복구, FSDP2·Context Parallelism 기반 분산 학습을 제공하며, 공개 DROID 데이터셋의 로봇 정책 학습과 Nano·Super 인지 Fine-tuning에 사용됩니다. 글의 비용 기준은 개별 작업의 최고 처리량이 아니라 예약된 GPU 시간당 전체 파이프라인 진척을 나타내는 GPU Goodput이며, Super 작업은 1~4노드에서 선형 대비 약 0.97~0.99의 강한 확장 효율을 기록했습니다.
섹션별 상세





kubectl delete pytorchjob cosmos3-droid-policy-hp
kubectl delete -f hyperpod-eks/serve-policy.yaml학습이 끝난 뒤 Cosmos 3 정책 학습 작업과 정책 서빙 Deployment를 삭제합니다.
aws fsx delete-file-system --file-system-idAmazon FSx for Lustre 파일 시스템을 삭제하는 명령의 시작 부분으로, 실제 파일 시스템 ID를 지정해야 합니다.
용어 해설
- Physical AI
- — Physical AI는 로봇이나 자율주행차처럼 현실 세계의 영상·이미지·행동·소리를 입력으로 받아 물리적 행동을 출력하는 인공지능입니다. 데이터 수집, 합성 데이터 생성, 정책 학습, 폐루프 평가를 반복하며 실제 환경에 대응하는 모델을 개선합니다.
- 모델 공장(Model Factory)
- — 모델 공장은 실제 데이터를 지속적으로 수집하고 합성 데이터로 보강한 뒤, 정책·인지 모델을 재학습하고 시뮬레이션에서 평가하는 운영 파이프라인입니다. 단일 학습 작업이 아니라 여러 단계가 같은 컴퓨팅·스토리지 자원을 순환하는 구조입니다.
- Mixture-of-Transformers
- — Mixture-of-Transformers는 하나의 Transformer 계열 구조 안에서 서로 다른 전문가가 역할을 나누는 설계입니다. Cosmos 3에서는 Reasoner가 다음 토큰을 예측하고 Generator가 영상·오디오·행동 토큰을 복원하며, 두 경로가 각 레이어의 attention으로 연결됩니다.
- Context Parallelism
- — Context Parallelism은 긴 입력 시퀀스를 여러 GPU에 분할해 처리하는 분산 학습 방식입니다. Cosmos 3처럼 영상 latent, 텍스트, 행동 토큰이 수만 개까지 이어지는 작업에서 FSDP2와 함께 여러 노드의 메모리와 연산을 나눠 사용합니다.
- GPU Goodput
- — GPU Goodput은 예약한 GPU 시간 전체에서 실제 파이프라인 진척으로 이어진 유용한 작업량을 뜻합니다. 이 글에서는 단일 작업의 최고 처리량보다 데이터 이동과 노드 재프로비저닝 손실을 포함한 전체 순환 작업의 효율을 비용 기준으로 삼습니다.
기술
- NVIDIA Cosmos 3
- Amazon SageMaker HyperPod
- Amazon EKS
- Amazon S3
- Amazon FSx for Lustre
- Elastic Fabric Adapter
- EFA
- NCCL
- vLLM-Omni
- cosmos-framework
- torchrun
- FSDP2
- Ulysses context parallelism
- Kubeflow PyTorchJob
- PyTorch Distributed Checkpoint
- AWS Deep Learning Containers
- Amazon Elastic Container Registry
- DROID
- BridgeData2
- LeRobot v3
- Cosmos3-Nano
- Cosmos3-Super
- Cosmos3-Edge
- LoRA
활용 사례
- 로봇 조작 정책 학습
- 자율주행 장면 합성
- 비라벨 로봇 영상의 행동 라벨링
- 로봇 정책의 폐루프 시뮬레이션 평가
- Physical AI 모델의 지속적 데이터 생성과 재학습
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.