TL;DR
NVIDIA Cosmos 3 Edge는 2B NVIDIA Nemotron 기반 reasoner를 포함한 4B Omni-Model을 로봇 조작 정책으로 Post-Training해 Jetson Thor에서 직접 실행하는 튜토리얼입니다. nvidia/Cosmos3-DROID의 성공 궤적 76k개로 카메라 영상과 관절·그리퍼 상태를 입력받아 15Hz 기준 32개 행동을 예측하도록 학습하고, 실제 제어에서는 행동 일부를 실행한 뒤 새 관측으로 재계획합니다. Jetson AGX Thor T5000에서 action chunk 생성 시간은 약 1.53초이며 가중치는 BF16 기준 약 9GB로 로봇 메모리에 들어갑니다. RoboLab 폐루프 평가 성공률은 22.9%로 Cosmos3 Nano의 36.8%보다 낮지만, 데이터센터 GPU 없이 실시간 완전 온보드 제어를 수행하는 설계상의 절충을 수치로 확인했습니다.
빠른 이해
새로운 점
4B World Foundation Model을 Jetson Thor에 올려 로봇 조작 정책으로 실행하는 Cosmos 3 Edge Post-Training 경로를 공개했습니다.
핵심 메커니즘
카메라 영상과 관절·그리퍼 상태, 작업 지시를 입력받아 Cosmos 3 Edge가 15Hz 기준 32개의 미래 joint position action을 예측하고, 제어기는 그중 앞부분을 실행한 뒤 새 관측으로 다시 계획합니다.
핵심 수치
- 모델 크기: 4B Omni-Model, 2B NVIDIA Nemotron 기반 reasoner- Cosmos 3 Edge 구성
- 온디바이스 가중치: 약 9GB BF16- Jetson Thor에서 policy server와 control client를 함께 실행
- Action chunk 지연시간: 약 1.53초- NVIDIA Jetson AGX Thor T5000, 640×540, 15Hz
- Chunk가 포괄하는 동작 시간: 약 2.13초- 다음 chunk가 현재 chunk 종료 전에 준비됨
- RoboLab 성공률: 22.9%- Post-Trained Edge 정책의 폐루프 평가
- Cosmos3 Nano 성공률: 36.8%- Edge와 inference compute·성공률 절충 비교
섹션별 상세
온디바이스 로봇 정책의 필요성
데이터와 Post-Training 구성
hf download nvidia/Cosmos3-DROID --repo-type dataset --local-dir /path/to/Cosmos3-DROIDHugging Face에서 Cosmos3-DROID 데이터셋을 내려받습니다.
학습 실행과 모델 설정
python -m cosmos_framework.scripts.convert_model_to_dcp \
-o /path/to/Cosmos3-Edge-dcp --checkpoint-path Cosmos3-EdgeCosmos 3 Edge 기본 체크포인트를 DCP 형식으로 변환합니다.
bash examples/launch_sft_action_policy_droid_edge.sh수정한 설정으로 Cosmos 3 Edge 로봇 행동 정책의 Post-Training을 실행합니다.
Jetson Thor에서의 실시간 제어
client = WebsocketClientPolicy(host="localhost", port=8000)
observation = {
"prompt": "put the marker in the basket",
"observation/wrist_image_left": np.asarray(Image.open("wrist.jpg")),
"observation/exterior_image_1_left": np.asarray(Image.open("left.jpg")),
"observation/exterior_image_2_left": np.asarray(Image.open("right.jpg")),
"observation/joint_position": np.zeros(7, dtype=np.float32), # smoke test only
"observation/gripper_position": np.float32(0.0), # smoke test only
}
result = client.infer(observation)
actions = result["action"] # [32, 8]: 7 joint positions + gripper, 15 HzWebSocket 정책 서버에 카메라·관절·그리퍼 상태를 보내 32개 행동 청크를 받는 스모크 테스트입니다.
while not task_done():
result = client.infer(get_observation())
execute_actions(result["action"][:16], hz=15) # first 16 of 32, then replan새로운 로봇 상태를 읽고 32개 예측 중 첫 16개만 실행한 뒤 다시 계획합니다.

RoboLab 폐루프 평가와 한계
용어 해설
- 월드 모델(World Model)
- — 월드 모델은 영상·언어·센서 데이터에서 물체의 움직임과 물리적 상호작용 패턴을 학습한 모델입니다. 입력된 관측으로 다음 상태나 행동을 예측하므로, 로봇 정책이 모든 물리 관계를 작업별 시연 데이터만으로 처음부터 학습하지 않아도 되는 기반을 제공합니다.
- Post-Training
- — Post-Training은 사전학습된 모델의 가중치와 구조를 특정 작업의 데이터에 맞춰 추가 학습하는 과정입니다. 이 글에서는 Cosmos 3 Edge가 로봇 관측을 입력받아 관절 위치와 그리퍼 행동을 출력하도록 DROID 궤적 데이터로 조정되며, 범용 물리 지식을 실제 제어 정책으로 연결합니다.
- Receding-Horizon Control
- — Receding-Horizon Control은 한 번에 여러 미래 행동을 예측한 뒤 그중 일부만 실행하고, 새 센서 관측으로 다시 계획하는 제어 방식입니다. 이 글의 정책은 32개 행동을 15Hz로 생성하고 앞부분을 실행한 뒤 재계획하여, 이전 예측과 실제 로봇 상태의 차이를 지속적으로 보정합니다.
- 폐루프 시뮬레이션(Closed-Loop Simulation)
- — 폐루프 시뮬레이션은 정책이 낸 행동을 물리 시뮬레이터에 적용하고, 그 결과로 생성된 새 관측을 다시 정책에 입력하는 평가 방식입니다. RoboLab은 이 순환을 120개 언어 조건 조작 작업에서 수행하므로, 고정된 데이터셋 예측이 아니라 행동 누적에 따른 실제 궤적과 성공률을 측정합니다.
- 분산 체크포인트(Distributed Checkpoint)
- — 분산 체크포인트는 대규모 학습을 위해 모델 가중치를 여러 장치와 프로세스가 읽을 수 있는 형식으로 저장한 파일 구조입니다. Cosmos 3 Edge의 기본 체크포인트를 DCP 형식으로 한 번 변환한 뒤, 64개 노드의 GB200 환경에서 분산 Post-Training을 실행하는 흐름이 사용됩니다.
기술
- NVIDIA Cosmos 3 Edge
- NVIDIA Nemotron
- NVIDIA Jetson Thor
- NVIDIA Jetson AGX Thor T5000
- DROID
- LeRobotDataset v3.0
- cosmos-framework
- OpenPI protocol
- WebSocket
- RoboLab
- Isaac Lab
- Isaac Sim
- CUDA 13.0
- BF16
- HSDP
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.