용어 해설
- 월드 모델(World Models)
- — 시계열 영상 또는 환경 상태를 예측하는 생성/표현 모델. 로봇 조작 맥락에서 과거 관찰을 기반으로 미래 상태를 예측해 temporal prior를 제공하므로 value estimation과 planning에 유리하다.
- 플로우 매칭(Flow Matching)
- — 잡음 샘플과 목표 샘플을 선형 보간한 중간 상태에 대해 '속도(velocity)'를 예측하도록 학습하는 확률밀도 흐름 기반 생성법. WVM에서는 value chunk와 미래 latent의 연속적 분포를 학습하는 목적 함수로 사용된다.
- Diffusion-Transformer(Diffusion-Transformer (DiT))
- — Transformer 아키텍처를 diffusion/flow 기반 생성 과정에 적용한 구조체로, 시계열 latent에 대해 denoising/velocity 예측을 수행해 미래 영상을 복원하거나 분포를 모델링한다. WVM의 video/value 스트림에 사용된다.
- Mixture-of-Transformers(Mixture-of-Transformers (MoT))
- — 별도 스트림(예: video stream, value stream)을 동일 Transformer 레이어 수준에서 선택적으로 결합하는 기법. WVM에서는 value token이 video token을 참조하도록 asymmetric attention을 구성해 표현 간 간섭을 최소화한다.
- Value-Order Correlation(Value-Order Correlation (VOC))
- — 전문가 시연에서 예측된 값의 순서(monotonicity)가 실제 작업 진행 순서와 얼마나 일치하는지 측정하는 지표. WVM은 Expert-VOC와 Suboptimal-Value-Bench의 Retry-VOC/Hesitation-RMSE로 평가된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.