본문으로 건너뛰기

GigaWorld-1과 WMBench를 통한 로봇 정책 평가용 월드 모델 설계와 검증

이 논문은 12,980시간의 데이터와 324,000개 롤아웃 분석을 바탕으로 WMBench를 제안하고 GigaWorld-1을 통해 월드 모델을 로봇 정책 평가자로 사용하는 설계 원칙과 실험적 근거를 제시한다.

용어 해설

월드 모델(World Model)
로봇 정책 평가 맥락에서 입력된 관찰과 정책의 행동을 받아 미래 관찰을 예측하는 시각-동작 조건 생성 모델이다. 이 모델은 반복적 롤아웃을 통해 정책의 성공률과 실패 모드를 추정하고 실제 실행과의 정렬도를 측정하는 데 사용된다. 월드 모델의 신뢰성은 장기 롤아웃 동안 행동 충실성, 지오메트리 보존성, 그리고 정책별 순위 보존 능력으로 판단된다.
World Model as Evaluator Score(WMES)
사람 평가자 또는 튜닝된 VLM이 부여하는 0–3의 서열형 점수로서 세계 모델 롤아웃이 실제 롤아웃의 성공 여부와 시각적·물리적 충실도를 얼마나 잘 보존하는지를 나타낸다. 이 점수는 모델별 평가 정렬도와 자동 지표의 상관관계를 측정하는 기준으로 사용된다. 점수 체계는 정확한 결과와 높은 충실도부터 완전 오작동까지 네 단계로 구성된다.
말단효과기 포즈 맵(End-Effector Pose Map)
헤드뷰용 제어 신호로서 로봇 말단효과기의 위치·자세·그리퍼 상태를 이미지 평면으로 투영한 픽셀 정렬 표현이다. 이 표현은 행동 의도를 공간적으로 정렬하여 월드 모델이 행동과 물체 반응을 연결하도록 돕는다. 보정된 카메트리 정보를 활용하여 다중 뷰 일관성을 유지하는 데 중요하다.
상대적 RoPE(Relative RoPE)
자유 길이의 자기회귀 롤아웃에서 절대시간 인덱스 대신 로컬 시점 좌표계를 사용하는 위치 인코딩 방식이다. 각 생성 단계에서 역사 컨텍스트와 현재 생성 윈도우를 합쳐 로컬 포지션을 재초기화하므로 장기 자가회귀에서 시간 표류가 줄어든다. 이로 인해 반복 롤아웃 중에 반복적인 동작과 시간적 불안정성이 감소한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.