본문으로 건너뛰기

로봇 조작을 위한 월드 기반 가치 모델

로봇 학습에서 각 프레임의 '진행도(value)'를 정확히 추정하면 저품질 데이터(망설임, 재시도)를 자동으로 걸러 정책 학습 효율을 높일 수 있다. 기존 VLM 기반 접근은 시공간 정보가 부족해 장단기 temporal 패턴(plateau, regression)을 잘 포착하지 못하는 반면, 월드 모델은 미래 예측 능력을 통해 더 정확한 진행도 추론을 제공한다.

용어 해설

월드 모델(World Models)
시계열 영상 또는 환경 상태를 예측하는 생성/표현 모델. 로봇 조작 맥락에서 과거 관찰을 기반으로 미래 상태를 예측해 temporal prior를 제공하므로 value estimation과 planning에 유리하다.
플로우 매칭(Flow Matching)
잡음 샘플과 목표 샘플을 선형 보간한 중간 상태에 대해 '속도(velocity)'를 예측하도록 학습하는 확률밀도 흐름 기반 생성법. WVM에서는 value chunk와 미래 latent의 연속적 분포를 학습하는 목적 함수로 사용된다.
Diffusion-Transformer(Diffusion-Transformer (DiT))
Transformer 아키텍처를 diffusion/flow 기반 생성 과정에 적용한 구조체로, 시계열 latent에 대해 denoising/velocity 예측을 수행해 미래 영상을 복원하거나 분포를 모델링한다. WVM의 video/value 스트림에 사용된다.
Mixture-of-Transformers(Mixture-of-Transformers (MoT))
별도 스트림(예: video stream, value stream)을 동일 Transformer 레이어 수준에서 선택적으로 결합하는 기법. WVM에서는 value token이 video token을 참조하도록 asymmetric attention을 구성해 표현 간 간섭을 최소화한다.
Value-Order Correlation(Value-Order Correlation (VOC))
전문가 시연에서 예측된 값의 순서(monotonicity)가 실제 작업 진행 순서와 얼마나 일치하는지 측정하는 지표. WVM은 Expert-VOC와 Suboptimal-Value-Bench의 Retry-VOC/Hesitation-RMSE로 평가된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 23.수집 2026. 06. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.