TL;DR
CVPR 2026에서는 World Model의 예측 대상이 영상뿐 아니라 predictive feature, 3D trace/point flow, 물리적 latent state 등으로 확장되는 흐름이 강조되었습니다. DeltaTok 계열은 feature 차이를 압축해 계산 효율을 높였고, TraceGen·PointWorld는 조작에 직접 필요한 3D 운동 표현으로 Planning에 바로 연결되는 출력을 제공합니다. Align While Search는 Frozen LLM을 Belief Updater와 Belief-Conditioned Simulator로 활용해 부분 관측 탐색을 정보 획득 관점에서 최적화하는 실용적 대안을 제시했습니다.
빠른 이해
새로운 점
CVPR 2026에서 확인된 연구들은 World Model을 단일 영상 생성기로 보기보다, 예측 대상과 활용 목적에 따라 representation을 분리하는 흐름을 강조합니다. DeltaTok 계열은 feature 차이를 압축해 multi-hypothesis 예측의 계산 비용을 낮추는 점에서 새로우며, TraceGen·PointWorld는 조작에 직접 필요한 3D 운동 표현으로 cross-embodiment 학습과 planning 연결을 시도한 점이 차별화됩니다. AWS는 Frozen LLM을 Belief Updater와 Belief-Conditioned Simulator로 재활용해 부분 관측 탐색을 정보 획득 관점에서 최적화한 점에서 실용적 신호가 있습니다.
핵심 메커니즘
대표적인 설계 패턴은 (입력 관측→표현 압축→예측 모델→plannning/제어)에 집중되며, 구체적으로는 Vision Foundation Model에서 얻은 feature를 delta token으로 압축하거나 3D 포인트·트레이스 공간으로 변환한 뒤 그 공간에서 액션-조건 예측을 수행하는 흐름이 있습니다. ParticleGS처럼 latent physical state를 부여하고 Neural ODE로 연속시간 진화를 학습하는 방식은 관측 범위를 넘어선 외삽 안정성에 도움을 줍니다. AWS는 관측 이력으로 갱신한 belief를 조건으로 LLM을 시뮬레이터로 호출해 후보 행동의 기대 정보 획득량을 비교하는 closed-loop를 구동하는 것이 핵심 메커니즘입니다.
섹션별 상세
World Model의 범위와 목적
- World Model의 예측 대상은 영상, 예측적 특징, 3D 궤적, 물리 상태 등으로 다양하며 각 표현은 downstream 결정 문제에 따라 적합성이 달라진다. — 본문 전체(Representation과 역할, 각 사례별 설명), Motus/DeltaWorld/TraceGen/PointWorld/ParticleGS/PCBWorld 섹션
표현과 역할의 두 축
Action-Controllable Video와 Motus


Predictive Feature: DeltaWorld 접근


- DeltaWorld는 Vision Foundation Model의 feature 차이를 Delta Token으로 압축해 multi-hypothesis 예측 비용을 크게 낮춘다. — DeltaWorld 설명 및 기술적 수치(프레임당 1,024개 토큰을 하나의 Delta Token으로 압축) — 해당 문단과 이미지 출처
3D Trace와 Point Flow 기반 예측

물리 기반 Latent Dynamics: ParticleGS
Belief-Conditioned Simulation: Align While Search
- AWS는 Frozen LLM을 Belief Updater와 Belief-Conditioned Simulator로 쓰고, 그 조건부 시뮬레이션을 통해 정보 획득형 탐색 행동을 선택한다. — Align While Search 섹션의 알고리즘적 루프 서술 및 Belief 상위·하위 표현 구조 출처
PCB 설계 자동화와 PCBWorld

용어 해설
- 월드 모델(World Model)
- — 현재까지의 관측과 행동을 요약한 상태로부터 미래의 환경 변화를 예측하는 모델군을 가리키며, 예측 대상은 영상, 잠재 표현, 궤적, 3D 기하 또는 물리 상태까지 다양합니다.
- 행동 제어형 비디오(Action-Controllable Video)
- — Agent나 사용자의 입력으로 특정 행동 시퀀스에 따른 미래 프레임을 생성하는 Video Generation 방식으로, 시각적 Rollout을 Learned Simulator로 직접 활용하는 목적에 초점이 맞춰집니다.
- 예측적 특징(Feature)(Predictive Feature)
- — 원시 픽셀 대신 Vision Foundation Model에서 추출한 특성 공간에서 시간에 따른 의미적 변화를 예측하는 표현으로, Pixel-복원 비용을 줄이면서 downstream 과제에 직결되는 정보를 보존합니다.
- 3차원 트레이스(3D Trace)
- — 조작 작업에서 물체와 End-Effector의 장면 중심 궤적을 3D 좌표계로 표현한 구조로, 카메라·외관 차이를 제거하고 조작에 필요한 기하학적 관계만을 유지합니다.
- 포인트 플로우(Point Flow)
- — 장면의 3D 포인트 각각이 주어진 로봇 액션에 따라 이동하는 변위를 예측하는 표현으로, Embodiment에 독립적인 공간적 변화 예측을 통해 Planning에 직접 연결됩니다.
- 믿음조건(베이리프) 시뮬레이션(Belief-Conditioned Simulation)
- — 부분 관측 환경에서 관측 이력으로 갱신한 잠재 구조(Belief)를 조건으로 두고 LLM 같은 모델로 행동 결과 관측을 근사적으로 생성하여 정보 획득형 행동을 선택하는 방법입니다.
기술
- Vision Foundation Model
- Neural ODE
- KiCad
- LLM
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

