본문으로 건너뛰기

Jetson Thor에서 실행하는 Cosmos 3 Edge 로봇 조작 정책

Cosmos 3 Edge가 Jetson Thor에서 로봇 행동을 실시간 생성합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

NVIDIA Cosmos 3 Edge는 2B NVIDIA Nemotron 기반 reasoner를 포함한 4B Omni-Model을 로봇 조작 정책으로 Post-Training해 Jetson Thor에서 직접 실행하는 튜토리얼입니다. nvidia/Cosmos3-DROID의 성공 궤적 76k개로 카메라 영상과 관절·그리퍼 상태를 입력받아 15Hz 기준 32개 행동을 예측하도록 학습하고, 실제 제어에서는 행동 일부를 실행한 뒤 새 관측으로 재계획합니다. Jetson AGX Thor T5000에서 action chunk 생성 시간은 약 1.53초이며 가중치는 BF16 기준 약 9GB로 로봇 메모리에 들어갑니다. RoboLab 폐루프 평가 성공률은 22.9%로 Cosmos3 Nano의 36.8%보다 낮지만, 데이터센터 GPU 없이 실시간 완전 온보드 제어를 수행하는 설계상의 절충을 수치로 확인했습니다.

빠른 이해

새로운 점

4B World Foundation Model을 Jetson Thor에 올려 로봇 조작 정책으로 실행하는 Cosmos 3 Edge Post-Training 경로를 공개했습니다.

핵심 메커니즘

카메라 영상과 관절·그리퍼 상태, 작업 지시를 입력받아 Cosmos 3 Edge가 15Hz 기준 32개의 미래 joint position action을 예측하고, 제어기는 그중 앞부분을 실행한 뒤 새 관측으로 다시 계획합니다.

핵심 수치

  • 모델 크기: 4B Omni-Model, 2B NVIDIA Nemotron 기반 reasoner- Cosmos 3 Edge 구성
  • 온디바이스 가중치: 약 9GB BF16- Jetson Thor에서 policy server와 control client를 함께 실행
  • Action chunk 지연시간: 약 1.53초- NVIDIA Jetson AGX Thor T5000, 640×540, 15Hz
  • Chunk가 포괄하는 동작 시간: 약 2.13초- 다음 chunk가 현재 chunk 종료 전에 준비됨
  • RoboLab 성공률: 22.9%- Post-Trained Edge 정책의 폐루프 평가
  • Cosmos3 Nano 성공률: 36.8%- Edge와 inference compute·성공률 절충 비교

섹션별 상세

01

온디바이스 로봇 정책의 필요성

로봇은 센서와 주변 환경, 수행 작업에 맞춰 행동을 바꾸면서도 탑재 컴퓨팅 하드웨어 안에서 정책을 실행해야 합니다. World Model은 물체가 떨어지고 미끄러지며 접촉에 반응하는 물리적 패턴을 사전학습하므로, 작업별 시연 데이터만으로 모든 관계를 다시 배우는 대신 로봇 정책 학습의 초기 기반으로 사용할 수 있습니다. 그러나 모델 가중치와 실행 상태가 로봇 메모리에 들어가야 하고 전체 추론 파이프라인이 필요한 제어 주기보다 빨라야 하므로, 대형 모델은 실제 로봇 배포에 제약이 있습니다. NVIDIA Cosmos 3 Edge는 4B Omni-Model과 2B NVIDIA Nemotron 기반 reasoner를 결합하고 NVIDIA Jetson Thor에서 실행할 수 있는 크기로 이 두 조건을 겨냥합니다.
02

데이터와 Post-Training 구성

이 튜토리얼의 정책은 nvidia/Cosmos3-DROID 데이터셋으로 학습하며, Franka Panda arm과 Robotiq gripper로 수집한 성공적인 원격조작 궤적 76k개가 약 350시간, 86개 작업, 564개 장면을 구성합니다. 데이터는 LeRobotDataset v3.0 형식의 640 × 360 영상으로 제공되고, 유휴·비작업 프레임을 걸러낸 뒤 성공 시연을 선택하며 학습 중 random cropping, rescaling, color jitter를 적용합니다. 설정상 입력은 손목 카메라와 두 외부 카메라를 합친 540 × 640 canvas, 관절 7개와 그리퍼를 포함한 8차원 절대 joint position action이며, 한 번의 예측에서 15Hz 기준 미래 행동 32개를 출력합니다. 검증된 학습 실행은 4× GB200 노드 64개에서 60K iterations를 약 68시간 동안 수행하므로, 단일 GPU Fine-tuning이 아니라 대규모 분산 Post-Training에 해당합니다.
bash
hf download nvidia/Cosmos3-DROID --repo-type dataset --local-dir /path/to/Cosmos3-DROID

Hugging Face에서 Cosmos3-DROID 데이터셋을 내려받습니다.

03

학습 실행과 모델 설정

실행 절차는 데이터셋 다운로드, Cosmos 3 Edge 기본 체크포인트의 DCP 변환, curation filter 적용, Post-Training launcher 실행 순서로 이어집니다. Cosmos 3 Nano용 설정 파일에서 NANO_MODEL_CONFIG를 EDGE_MODEL_CONFIG로 교체하고 변환된 Edge 체크포인트 경로를 지정한 뒤 launcher 이름을 Edge용으로 바꾸며, 데이터셋·action space·curation filter·학습 일정은 그대로 유지합니다. 표의 설정은 새로 초기화한 encoder, decoding MLP, embedding tokens에 5배 learning-rate multiplier를 적용하고, vision flow-matching 손실과 action 손실의 균형을 맞추며, learning rate 2e-4와 global batch 8192를 사용합니다. 학습은 long-cosine decay와 100K cycle을 따르고 1K iterations마다 체크포인트를 저장하도록 구성되어 재현 가능한 실험 흐름을 만듭니다.
bash
python -m cosmos_framework.scripts.convert_model_to_dcp \
-o /path/to/Cosmos3-Edge-dcp --checkpoint-path Cosmos3-Edge

Cosmos 3 Edge 기본 체크포인트를 DCP 형식으로 변환합니다.

bash
bash examples/launch_sft_action_policy_droid_edge.sh

수정한 설정으로 Cosmos 3 Edge 로봇 행동 정책의 Post-Training을 실행합니다.

04

Jetson Thor에서의 실시간 제어

학습된 정책은 OpenPI protocol을 사용하는 WebSocket policy server로 제공되며, client가 관측 dictionary를 보내면 server가 action chunk를 반환합니다. Edge 정책의 가중치는 BF16 기준 약 9GB이므로 server와 control client를 모두 Jetson Thor에서 실행할 수 있고, host를 localhost로 지정하면 요청이 로봇 밖의 data-center GPU로 나가지 않습니다. NVIDIA Jetson AGX Thor T5000에서 640×540 해상도와 15Hz 설정으로 한 action chunk를 만드는 데 약 1.53초가 걸리며, 각 chunk가 약 2.13초의 로봇 동작을 포함해 다음 chunk가 준비되기 전에 현재 동작이 끝나지 않도록 합니다. 실제 제어에서는 카메라와 관절·그리퍼 상태를 새로 읽고 32개 행동 중 앞의 16개를 15Hz로 실행한 뒤 다시 추론하므로, state-conditioned 정책이 실제 팔 위치에서 재계획을 시작합니다.
python
client = WebsocketClientPolicy(host="localhost", port=8000)
observation = {
    "prompt": "put the marker in the basket",
    "observation/wrist_image_left": np.asarray(Image.open("wrist.jpg")),
    "observation/exterior_image_1_left": np.asarray(Image.open("left.jpg")),
    "observation/exterior_image_2_left": np.asarray(Image.open("right.jpg")),
    "observation/joint_position": np.zeros(7, dtype=np.float32), # smoke test only
    "observation/gripper_position": np.float32(0.0), # smoke test only
}
result = client.infer(observation)
actions = result["action"] # [32, 8]: 7 joint positions + gripper, 15 Hz

WebSocket 정책 서버에 카메라·관절·그리퍼 상태를 보내 32개 행동 청크를 받는 스모크 테스트입니다.

python
while not task_done():
    result = client.infer(get_observation())
    execute_actions(result["action"][:16], hz=15) # first 16 of 32, then replan

새로운 로봇 상태를 읽고 32개 예측 중 첫 16개만 실행한 뒤 다시 계획합니다.

흰색 로봇 arm이 작업대 위의 도구를 집는 장면입니다.
Screenshot이미지는 Cosmos 3 Edge 정책이 카메라 관측과 로봇 상태를 바탕으로 manipulation action을 생성하는 실제 작업 흐름을 시각화합니다. 본문에서 설명한 action chunk 예측과 폐루프 재계획이 도구 집기처럼 연속적인 조작 행동으로 이어지는 사례이며, 로봇이 데이터센터 GPU가 아니라 탑재 하드웨어에서 제어된다는 온디바이스 배포 맥락과 연결됩니다.
05

RoboLab 폐루프 평가와 한계

물리 로봇에 적용하기 전에는 RoboLab 시뮬레이션에서 정책을 검증할 수 있으며, RoboLab client는 같은 정책 server에 연결해 action chunk를 물리 환경에 적용하고 렌더링된 새 관측을 다시 전달합니다. 이 과정은 120개 언어 조건 manipulation task에서 행동과 관측을 순환시키고, 각 실행에서 viewport·robot-camera video와 성공 로그를 남겨 결과뿐 아니라 해당 결과를 만든 궤적도 확인하게 합니다. 폐루프 RoboLab 평가에서 Post-Trained Edge 정책의 성공률은 22.9%였고, 더 큰 Cosmos3 Nano는 36.8%를 기록해 Edge가 inference compute와 성공률 사이의 절충을 택했음을 수치로 나타냅니다. 따라서 이 결과는 대형 모델과 동일한 성능을 보장한다는 뜻이 아니라, 4B World Foundation Model이 Jetson AGX Thor 메모리 안에서 완전히 실행되며 실시간 로봇 정책 backbone으로 평가됐다는 의미를 가집니다.

용어 해설

월드 모델(World Model)
월드 모델은 영상·언어·센서 데이터에서 물체의 움직임과 물리적 상호작용 패턴을 학습한 모델입니다. 입력된 관측으로 다음 상태나 행동을 예측하므로, 로봇 정책이 모든 물리 관계를 작업별 시연 데이터만으로 처음부터 학습하지 않아도 되는 기반을 제공합니다.
Post-Training
Post-Training은 사전학습된 모델의 가중치와 구조를 특정 작업의 데이터에 맞춰 추가 학습하는 과정입니다. 이 글에서는 Cosmos 3 Edge가 로봇 관측을 입력받아 관절 위치와 그리퍼 행동을 출력하도록 DROID 궤적 데이터로 조정되며, 범용 물리 지식을 실제 제어 정책으로 연결합니다.
Receding-Horizon Control
Receding-Horizon Control은 한 번에 여러 미래 행동을 예측한 뒤 그중 일부만 실행하고, 새 센서 관측으로 다시 계획하는 제어 방식입니다. 이 글의 정책은 32개 행동을 15Hz로 생성하고 앞부분을 실행한 뒤 재계획하여, 이전 예측과 실제 로봇 상태의 차이를 지속적으로 보정합니다.
폐루프 시뮬레이션(Closed-Loop Simulation)
폐루프 시뮬레이션은 정책이 낸 행동을 물리 시뮬레이터에 적용하고, 그 결과로 생성된 새 관측을 다시 정책에 입력하는 평가 방식입니다. RoboLab은 이 순환을 120개 언어 조건 조작 작업에서 수행하므로, 고정된 데이터셋 예측이 아니라 행동 누적에 따른 실제 궤적과 성공률을 측정합니다.
분산 체크포인트(Distributed Checkpoint)
분산 체크포인트는 대규모 학습을 위해 모델 가중치를 여러 장치와 프로세스가 읽을 수 있는 형식으로 저장한 파일 구조입니다. Cosmos 3 Edge의 기본 체크포인트를 DCP 형식으로 한 번 변환한 뒤, 64개 노드의 GB200 환경에서 분산 Post-Training을 실행하는 흐름이 사용됩니다.

기술

  • NVIDIA Cosmos 3 Edge
  • NVIDIA Nemotron
  • NVIDIA Jetson Thor
  • NVIDIA Jetson AGX Thor T5000
  • DROID
  • LeRobotDataset v3.0
  • cosmos-framework
  • OpenPI protocol
  • WebSocket
  • RoboLab
  • Isaac Lab
  • Isaac Sim
  • CUDA 13.0
  • BF16
  • HSDP

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 20.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.