TL;DR
일반화 가능한 범용 로봇 조작 정책의 진전에는 시뮬레이션 기반 진단과 실세계 배포 검증을 결합한 일관된 평가가 필요하다. RoboDojo는 시뮬레이션에서 빠른 반복 평가를 지원하는 42개 과제와 재현 가능한 실세계 원격 평가를 위한 18개 과제를 함께 제공하여 두 환경을 연결하는 통일된 루프를 마련했다. 이로 인해 연구자는 시뮬레이션에서의 개선이 실물 배포에서 어떻게 반영되는지를 체계적으로 확인할 수 있다.
왜 중요한가
일반화 가능한 범용 로봇 조작 정책의 진전에는 시뮬레이션 기반 진단과 실세계 배포 검증을 결합한 일관된 평가가 필요하다. RoboDojo는 시뮬레이션에서 빠른 반복 평가를 지원하는 42개 과제와 재현 가능한 실세계 원격 평가를 위한 18개 과제를 함께 제공하여 두 환경을 연결하는 통일된 루프를 마련했다. 이로 인해 연구자는 시뮬레이션에서의 개선이 실물 배포에서 어떻게 반영되는지를 체계적으로 확인할 수 있다.
핵심 기여
통합 시뮬레이션·실세계 평가 시스템 구축
RoboDojo는 동일한 정책 인터페이스와 평가 파이프라인을 통해 시뮬레이션과 실세계 테스트를 연결하는 통합 시스템을 구축했다. 이 시스템은 정책을 한 번 통합하면 시뮬레이션 내 대규모 진단과 표준화된 원격 실세계 평가 모두에 재사용할 수 있도록 설계되어 있다. 표준화된 하드웨어 배치, 장면 리셋 절차, 채점 프로토콜을 포함한 RoboDojo-RealEval은 재현 가능한 물리적 검증을 가능하게 한다.
광범위 능력 축을 담은 벤치마크 구성
시뮬레이션 벤치마크는 일반화, 메모리, 정밀도, 장기수행, 개방형 지시의 다섯 축으로 42개 과제를 구성하여 능력 지향 진단을 지원한다. 실세계 벤치마크는 ARX X5, Piper, Piper X의 세 가지 로봇 체현을 포함한 18개 과제로 물리적 배포 조건을 점검한다. 각 시뮬레이션 과제는 에피소드당 50회 평가, 전체 시뮬레이션은 2,100 에피소드로 규격화되어 집계의 일관성을 확보했다.
XPolicyLab을 통한 정책 통합 및 공개 리더보드 운영
XPolicyLab은 다양한 로봇 정책을 동일한 관찰-행동 인터페이스로 연결하는 인프라로서 30개 정책을 통합했다. 이 표준화 계층은 정책의 훈련·배포·평가 파이프라인을 일관되게 관리하여 리더보드 검증 단계에서 체크포인트와 설정을 공개하도록 요구한다. 또한 원격 평가를 가능하게 하는 배포 프로토콜을 제공하여 연구자가 코드 공개 없이도 검증된 제출을 할 수 있는 흐름을 마련했다.
물리적 사실성 확보를 위한 자산 라이브러리와 이질 병렬 시뮬레이션
RoboDojo는 강체·관절·변형 자산을 물리 특성으로 표준화한 디지털 자산 라이브러리를 구축했다. heterogeneous parallel simulation 설계는 병렬 환경마다 서로 다른 장면 구성과 자산 집합을 유지하면서 벡터화된 실행 인터페이스로 처리량을 개선했다. 이 결과 제로 액션 롤아웃에서 77.4 interactions/s 같은 처리량 개선이 보고되어 대규모 평가의 실용성을 확보했다.
관련 Figure

이 그림은 42개의 시뮬레이션 태스크와 18개의 실세계 태스크의 예시 스냅샷을 보여주어 태스크 다양성과 능력 축(Generalization, Memory, Precision, Long-Horizon, Open)의 분포를 직관적으로 전달한다. 각 태스크의 시각적 난이도와 인터랙션 유형(삽입, 적재, 정렬 등)을 비교할 수 있어 벤치마크의 구성과 난이도 설계 의도를 확인하는 근거 자료로 활용된다. 또한 Generalization 분할의 표준 대 랜덤 설정을 시각적으로 보강한다.
시뮬레이션과 실세계에서의 태스크 오버뷰를 격자 형태로 정리한 태스크 배치도이다.
핵심 아이디어 이해하기
범용 로봇 조작 정책의 평가는 단순히 성공률 한 가지 지표만으로는 성능의 결점을 진단하기 어렵다. 로봇 조작에는 시각적 일반화, 과거 관찰 정보의 활용, 미세한 공간 정밀성, 여러 단계로 이어지는 장기 수행, 그리고 개방형 언어 지시의 의미 해석이 동시에 요구되어 각 능력 축별로 별도의 진단이 필요하다. RoboDojo는 이러한 각 능력 축을 분리된 평가 세트로 설계하여 어떤 정책이 어느 축에서 약한지를 정밀하게 드러내는 것을 핵심 직관으로 삼았다. RoboDojo는 시뮬레이션과 실세계의 장점을 상호보완적으로 활용한다는 점에서 기존 단일 환경 벤치마크와 차별화된다. 시뮬레이션은 빠른 반복과 광범위한 장면 무작위화를 통해 능력별 스트레스 테스트를 제공하며, 실세계는 센서 노이즈·접촉 동역학·구동 오차 같은 물리적 요인을 드러내 실제 배포 가능성을 검증한다. 두 환경을 동일한 정책 인터페이스로 연결하면 시뮬레이션에서의 개선이 실제 배포에서 어떻게 전이되는지, 그리고 전이되지 않는 경우 어떤 하위 요소(정밀 제어, 접촉 복구 등)가 병목인지 파악할 수 있다. 또한 RoboDojo는 평가의 재현성과 공정성을 핵심 목표로 설정했다. 이를 위해 실세계 평가 플랫폼인 RoboDojo-RealEval은 하드웨어 레이아웃·조명·카메라 위치·장면 리셋 절차를 표준화하고, 원격 클라우드 평가와 이중 블라인드 채점 프로토콜을 도입하여 서로 다른 제출물과 세션 간 일관된 비교가 가능하도록 했다. 이러한 설계는 단순한 점수 경쟁을 넘어서 실제 배포 안정성, 행동의 시간적 부드러움, 복구 능력 등 운영적 속성까지 평가의 범위로 포함시키는 직관을 반영한다.
방법론
전체 접근 방식은 세 구성 요소로 요약된다: 시뮬레이션 평가 플랫폼, 실세계 원격 평가 플랫폼, 그리고 정책 통합을 위한 XPolicyLab 인프라이다. 시뮬레이션 플랫폼은 Isaac Sim과 MagicSim 기반의 설정 파일(YAML)로 장면을 구성하고, 각 리셋 시에 객체 포즈·배치·조명·배경 텍스처를 결정하는 결정론적 시드 제어를 제공하여 재현 가능한 무작위화를 수행한다. 이 설계는 동일한 런타임에서 서로 다른 태스크 스펙을 독립적으로 인스턴스화할 수 있게 하여 heterogeneous parallel simulation을 가능하게 했다. 핵심 메커니즘은 자산 어노테이션과 기술 재사용 기반의 시연 합성에 있다. 각 자산은 잡기 가능한 영역, 배치 영역, 상호작용 포인트 같은 조작용 메타데이터를 포함하며, 자동 합성 모드에서는 재사용 가능한 저수준 기술들(grasp, place, handover, insert 등)을 조합해 데모를 생성한다. 합성이 어려운 장면은 VR 기반 텔레오퍼레이션으로 고품질 데모를 수집하고, 수집된 궤적은 검수 과정을 통해 프레임 단위로 필터링하여 훈련 데이터로 정리했다. 평가 측면에서는 시뮬레이션에서 각 태스크를 50 에피소드로 실행하고 Generalization 태스크는 표준 25 에피소드와 랜덤 25 에피소드로 분리하여 표준·무작위 설정 간 성능 저하를 정량화한다. 실세계 평가는 RoboDojo-RealEval을 통해 각 태스크당 10회 평가, 세 명의 평가자에 의한 이중 블라인드 채점으로 최종 점수를 산출한다. 또한 리더보드 검증을 위해 제출 모델은 세 개의 랜덤 시드 평균 및 표준편차를 보고하도록 요구되며, 공개 레이아웃과 숨김 검증 레이아웃을 병행하여 과적합을 억제한다.
관련 Figure

이 그림은 RoboDojo가 시뮬레이션, RoboDojo-RealEval, XPolicyLab, 리더보드로 구성된 통합 파이프라인이라는 구조적 정보를 전달한다. 각 요소가 어떤 역할을 하는지와 시뮬레이션·실세계 평가를 연결하는 인터페이스 존재를 시각적으로 확인할 수 있다. 이 도식은 논문 본문에 제시된 통합 평가 흐름과 기준을 보강하는 근거로 쓰인다.
RoboDojo의 전체 구조와 구성 요소를 요약한 개요 도식이다.

이 그림은 RoboDojo-RealEval의 원격 평가 가능성과 서로 다른 물리적 배치에서 일관된 평가를 수행할 수 있는 워크플로를 시각화한다. 원격 제출자가 클라우드를 통해 정책을 평가 환경에 연결하고 일관된 레이아웃 재현을 통해 실험을 반복할 수 있음을 시사한다. 따라서 원격 실세계 검증과 중앙화된 리더보드 운영의 근거 자료로 작동한다.
글로벌 원격 실세계 평가를 개념적으로 보여주는 지도 기반 다중 설치 예시 이미지이다.

이 사진은 heterogeneous parallel simulation의 구현 효과를 보여주며, 병렬 환경마다 서로 다른 배경과 객체 구성이 실행되는 것을 시각적으로 나타낸다. 논문에서 보고한 처리량 개선 수치(예: 77.4 interactions/s)는 이와 같은 병렬 처리가 가능했기 때문에 실현되었음을 뒷받침하는 근거로 연결된다. 따라서 대규모 평가의 실용성 주장을 강화하는 증거 이미지로 기능한다.
이질 병렬 시뮬레이션으로 여러 장면을 동시에 실행하는 장면 배열의 렌더 샷이다.
주요 결과
시뮬레이션 리더보드 결과는 현재 범용 조작 정책과 인간 원격조작자 간에 큰 성능 격차가 존재함을 드러냈다. 최고 성능 정책이 평균 성공률 약 8.80%와 평균 점수 13.07을 기록한 반면 인간 텔레오퍼레이터는 약 76.03% 성공률과 80.42 점수를 기록하여 실용적 완성도에는 상당한 간극이 존재한다. 이 결과는 다양한 능력 축에서 현재 정책들이 부분적 진전을 이루었으나 균형 잡힌 범용성에는 미치지 못함을 의미한다. 도메인 랜덤화 실험은 장면 수준 무작위화가 대다수 정책의 성능을 광범위하게 붕괴시킨다는 점을 보여주었다. 표준 설정에서 강세를 보이던 모델도 랜덤화 환경에서 대규모 성능 하락을 보였으며, Spatial Forcing 같은 공간적 그라운딩 설계가 상대적 유지율을 개선했지만 절대 성능은 여전히 낮았다. 이 결과는 시각적 인지 향상만으로는 공간적 정밀성·폐루프 제어·복구 행동과 같은 저수준 제어 문제를 해결할 수 없음을 시사한다. 실세계 리더보드에서는 시뮬레이션 성능과 완전한 정렬이 이루어지지 않았고 배포 관련 불안정성이 두드러졌다. 최고 정책의 전체 실세계 성공률은 약 12.8%였고 인간 원격 조작자의 100%와 큰 차이를 보였다. 실세계는 제어 신호의 진동, 접촉 불안정, 안전 관련 행동 등 시뮬레이션에서는 완전히 드러나지 않는 결함을 노출했으며 이는 배포 지향적 안정성 개선이 필요함을 의미한다.
기술 상세
전체 아키텍처는 세 모듈로 구성된다: Isaac Sim 기반 시뮬레이션 플랫폼, RoboDojo-RealEval 실세계 플랫폼, 그리고 XPolicyLab 정책 통합 레이어이다. 시뮬레이션 플랫폼은 MagicSim의 모듈식 매니저 아키텍처와 YAML 기반 장면 사양을 사용하여 각 리셋 시에 객체, 포즈, 조명, 배경 텍스처를 결정하는 결정론적 시드를 지원하며, 이를 통해 재현 가능한 무작위화와 장면 다양성을 동시에 확보했다. 디지털 자산 라이브러리는 Meshy AI 등에서 수집한 강체·관절·변형 자산을 물리 파라미터와 충돌 기하로 표준화하여 접촉이 많은 조작에서 안정적인 거동을 유지하도록 준비했다. 핵심 알고리즘적 구성은 이질 병렬 시뮬레이션과 자산 어노테이션 기반의 데모 합성이다. heterogeneous parallel simulation은 벡터화 인터페이스 아래에서 각 환경이 서로 다른 장면 템플릿을 가지도록 하여 병렬 처리 효율과 장면 다양성의 트레이드오프를 해소했다. 자동 합성 모드는 재사용 가능한 저수준 스킬(grasp, place, handover, insert 등)을 cuRobo v2 모션 플래너로 실행하여 대량의 데모를 합성하고, VR 텔레오퍼레이션은 합성이 어려운 과제의 고품질 데모를 확보하는 보완 수단으로 사용되었다. 평가 및 검증 절차는 수치 측정과 재현성 제어에 중점을 두었다. 시뮬레이션에서는 각 과제당 50 에피소드(Generalization은 표준 25 + 랜덤 25)를 실행하고 성공률과 평균 점수를 모두 보고한다. 실세계 검증은 각 과제당 10회 시험과 세 명의 이중 블라인드 평가자 점수의 평균을 사용하며, 제출 모델은 3개의 랜덤 시드 결과와 숨김 레이아웃 검증을 충족해야 공식 리더보드에 등재된다.
관련 Figure

이 이미지는 강체, 소도구, 의류 등 다양한 자산 카테고리를 시연하여 시뮬레이션 장면 구성에서 사용되는 물체 다양성을 강조한다. 자산들이 물리적 파라미터와 조작 가능 영역으로 표준화되어 있음을 뒷받침하는 시각 증거로 활용된다. 따라서 접촉이 많은 조작에서 자산의 물리적 사실성이 왜 중요한지에 대한 직관적 근거를 제공한다.
디지털 자산 라이브러리의 다양한 물체 샘플을 정렬해 보여주는 시각 자료이다.
한계점
논문이 명시적으로 언급한 한계는 실세계 평가가 하드웨어 비용, 실행 시간, 인간 리셋 노력 및 안전 고려 때문에 포괄적이지 않고 소형의 도전적 테스트셋으로 설계되었다는 점이다. 또한 RoboDojo는 시뮬레이션과 실세계 간에 과제의 일대일 매칭을 전제하지 않으며, 따라서 sim-to-real 성능의 직접적인 정량적 전이를 측정하는 전용 벤치마크로 설계되지는 않았다. 숨김 레이아웃 검증과 공개 레이아웃 사용으로 과적합을 억제하려는 장치가 존재하지만, 시간이 지남에 따라 리더보드 게임화나 과도한 휴리스틱 튜닝 위험이 잔존할 수 있음을 언급했다.
실무 활용
RoboDojo는 연구자가 시뮬레이션에서 대규모 진단을 수행하고 동일한 정책을 표준화된 실세계 환경으로 원격 배포하여 재현 가능한 실험을 수행할 수 있는 실질적 인프라를 제공한다. 공개된 GitHub 저장소와 표준 인터페이스는 정책 통합과 재현성을 용이하게 하여 리더보드 기반 비교 연구의 실무 적용을 촉진한다. 원격 평가 절차와 검증 파이프라인은 외부 기관에서도 일관된 실험 결과를 얻도록 설계되어 실제 연구·산업 협업에 적용 가능하다.
- 범용 로봇 정책의 능력별 약점 진단과 개선 방향 탐색을 위한 대규모 비교 평가
- 시뮬레이션 단계에서의 빠른 모델 반복 후 동일 인터페이스로 실세계 검증을 수행하는 워크플로 개발
- 학계·산학 공동 연구에서 표준화된 실세계 재현 환경을 통한 원격 벤치마크 제출 및 검증
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Sim-to-Real
- — 시뮬레이션에서 학습한 로봇 정책을 실세계 로봇에 적용하는 과정이며, 물리적 접촉, 관성, 센서 노이즈 등 시뮬레이터와 실환경의 차이가 전이 성능에 큰 영향을 미치기 때문에 로봇 조작 연구에서 핵심적인 검증 축이다.
- Domain Randomization
- — 시뮬레이션 환경에서 배경, 조명, 잡동사니 배치, 물체 외형 등을 의도적으로 무작위화하여 모델이 특정 시뮬레이션 설정에 과적합되는 것을 억제하고 시뮬레이션-실세계 일반화를 향상시키는 기법이다.
- Heterogeneous Parallel Simulation
- — 병렬로 여러 시뮬레이션 인스턴스를 실행할 때 각 인스턴스가 서로 다른 장면 구성, 물체 집합, 관절 구조 등을 가지도록 구성하여 병렬 처리 효율을 유지하면서 장면 다양성을 확보하는 실행 방식이다.
- Open-Vocabulary Grounding
- — 훈련 시 본 적 없는 언어 지시를 받아 시각적 대상과 조작 스킬을 연결하는 능력으로, 로봇이 새로운 지시를 의미적으로 해석하여 적절한 조작 행동으로 변환해야 하는 문제 설정이다.
- Bimanual Manipulation
- — 두 개의 로봇 팔을 협업시켜 대상의 이송, 핸드오버, 동시 제어 등 복합적 조작을 수행하는 기술적 과제로서 공간적 협업, 타이밍, 충돌 처리 등 추가적 난제를 포함한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
