본문으로 건너뛰기
LG AI Research조회 2

World Model의 예측 대상과 활용

CVPR 2026은 영상 중심 World Model에서 task-aligned 표현(Delta Token, 3D Trace, Point Flow, latent physics)으로 확장되는 흐름을 보였습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

CVPR 2026에서는 World Model의 예측 대상이 영상뿐 아니라 predictive feature, 3D trace/point flow, 물리적 latent state 등으로 확장되는 흐름이 강조되었습니다. DeltaTok 계열은 feature 차이를 압축해 계산 효율을 높였고, TraceGen·PointWorld는 조작에 직접 필요한 3D 운동 표현으로 Planning에 바로 연결되는 출력을 제공합니다. Align While Search는 Frozen LLM을 Belief Updater와 Belief-Conditioned Simulator로 활용해 부분 관측 탐색을 정보 획득 관점에서 최적화하는 실용적 대안을 제시했습니다.

빠른 이해

새로운 점

CVPR 2026에서 확인된 연구들은 World Model을 단일 영상 생성기로 보기보다, 예측 대상과 활용 목적에 따라 representation을 분리하는 흐름을 강조합니다. DeltaTok 계열은 feature 차이를 압축해 multi-hypothesis 예측의 계산 비용을 낮추는 점에서 새로우며, TraceGen·PointWorld는 조작에 직접 필요한 3D 운동 표현으로 cross-embodiment 학습과 planning 연결을 시도한 점이 차별화됩니다. AWS는 Frozen LLM을 Belief Updater와 Belief-Conditioned Simulator로 재활용해 부분 관측 탐색을 정보 획득 관점에서 최적화한 점에서 실용적 신호가 있습니다.

핵심 메커니즘

대표적인 설계 패턴은 (입력 관측→표현 압축→예측 모델→plannning/제어)에 집중되며, 구체적으로는 Vision Foundation Model에서 얻은 feature를 delta token으로 압축하거나 3D 포인트·트레이스 공간으로 변환한 뒤 그 공간에서 액션-조건 예측을 수행하는 흐름이 있습니다. ParticleGS처럼 latent physical state를 부여하고 Neural ODE로 연속시간 진화를 학습하는 방식은 관측 범위를 넘어선 외삽 안정성에 도움을 줍니다. AWS는 관측 이력으로 갱신한 belief를 조건으로 LLM을 시뮬레이터로 호출해 후보 행동의 기대 정보 획득량을 비교하는 closed-loop를 구동하는 것이 핵심 메커니즘입니다.

섹션별 상세

World Model의 범위와 목적

World Model은 관측과 행동 이력을 입력으로 미래의 어떤 표현을 예측할지를 정의하는 개념적 틀입니다. 어떤 모델은 사람이 볼 수 있는 전체 영상(Video)을 생성하고, 다른 모델은 Vision Foundation Model의 feature 변화나 조작에 직접 필요한 3D 궤적, 포인트 플로우, 혹은 물리적 상태 같은 Task-연결 표현을 출력합니다. 서로 다른 표현은 계산 비용·보존 정보·Downstream 정렬 측면에서 장단점이 명확하므로, 좋은 World Model은 목표 행동 결정에 필요한 예측 대상을 최소한으로 정확하게 보존하는 방향으로 설계되는 것이 핵심입니다.
근거
  • World Model의 예측 대상은 영상, 예측적 특징, 3D 궤적, 물리 상태 등으로 다양하며 각 표현은 downstream 결정 문제에 따라 적합성이 달라진다. 본문 전체(Representation과 역할, 각 사례별 설명), Motus/DeltaWorld/TraceGen/PointWorld/ParticleGS/PCBWorld 섹션

표현과 역할의 두 축

World Model을 구분하는 첫 번째 축은 무엇을 예측하느냐(Observation, Predictive Feature, Trajectory, Physical State)이고 두 번째 축은 예측 결과를 어디에 쓰느냐(시각적 검증, Planning, Control, Exploration)입니다. 픽셀 기반 Rollout은 전체 관측을 보존하지만 비용이 크고, Feature 기반 예측은 효율적이나 무엇을 보존할지 설계 단계에서 결정해야 합니다. 각 표현의 적절성은 downstream decision problem과 직접 연결되므로, 모델을 평가할 때는 단순한 화질 지표가 아니라 예측 표현이 실제 의사결정 성능에 미치는 영향을 근거로 판단해야 합니다.

Action-Controllable Video와 Motus

Action-Controllable Video 계열은 사용자의 입력이나 Agent의 행동에 반응해 미래 프레임을 생성하며 Learned Simulator로 활용될 수 있습니다. Motus는 Video Generation, 환경 이해, Action Prediction을 각각의 expert 모듈로 통합하고 Latent Action을 통해 서로 다른 로봇·비디오 데이터에서 공통 모션 구조를 공유하도록 설계하여 단일 아키텍처로 여러 모드를 다루는 접근을 제시합니다. 이 방식은 영상 기반 Rollout이 제공하는 직관적 가시성과 Action·Perception 신호를 학습적으로 연결하는 장점을 살리지만, 모든 픽셀을 생성해야 하는 비용과 World-Model Fidelity 검증 문제를 해결해야 한다는 한계도 함께 드러납니다.
학회 포스터와 발표 현장 사진이 결합된 이미지로, 모델 구조와 주요 결과를 현장 맥락에서 보여 줍니다.
Photo포스터 사진은 Motus 등의 시스템이 학회에서 어떻게 프레젠테이션되었는지, 팀이 어떤 아키텍처 다이어그램과 실험 결과를 강조했는지를 시각적으로 확인하게 합니다. 연구 현장 사진은 모델의 구현·데이터·시연 방식이 실험적 재현성과 연결되어 있음을 시사하므로, 아티팩트·데모 중심 증거로서 유용합니다. 다만 인물 식별 정보는 제공하지 않으므로 기술적 내용 해석에만 초점을 맞춰야 합니다.
Motus 또는 통합 아키텍처를 도식화한 다이어그램으로, Video, Action, Understanding expert의 상호 연결을 보입니다.
Diagram아키텍처 다이어그램은 여러 expert가 공동으로 작동하는 입력→처리→출력 흐름을 한눈에 보여 주며 Latent Action의 역할과 모드 전환 메커니즘을 시각적으로 이해하게 합니다. 입력으로 영상·로봇 데이터가 들어오고 내부에서 공통 모션 구조를 추출해 여러 prediction task로 분기하는 점이 도식에서 명확히 드러납니다. 이 그림은 Motus의 설계 철학이 Video와 Action 신호를 학습적으로 결합하는 데 있음을 근거로 제시합니다.

Predictive Feature: DeltaWorld 접근

픽셀을 전부 복원하는 대신 Vision Foundation Model의 연속 프레임 특성 차이를 Compact한 Delta Token으로 압축해 복수의 개연적 미래를 생성하는 방식이 DeltaWorld에서 제안됩니다. 입력으로는 VFM의 feature와 이를 차분해 얻은 delta token이 들어가고, 모델은 이 token 시퀀스 상에서 Multi-Hypothesis Forecasting을 수행하여 segmentation·depth 예측처럼 의미적 downstream 과제에 직접 정렬되는 출력을 만듭니다. 이 접근은 공간 토큰 수를 프레임당 수천개에서 하나의 Delta Token으로 줄여 계산 비용을 획기적으로 낮추면서 예측된 feature가 실제 의미적 변화와 얼마나 잘 정렬되는지를 기준으로 성능을 평가하도록 설계된 점이 핵심 증거입니다.
DeltaTok 기반의 토크나이저와 세 개의 모듈(비디오 제너레이터, 액션 익스퍼트, 이해 익스퍼트)을 보여 주는 구조 다이어그램입니다.
Diagram이 다이어그램은 DeltaWorld 계열 설계에서 feature 차이(delta token)를 어떻게 생성·압축하고, 그 위에서 다중 가설을 생성하는지를 단계별로 나타냅니다. 입력 feature→Delta Tokenizer→Tri-model Joint Attention→각 Decoder(비디오·액션·이해)로 이어지는 처리 흐름이 시각적 증거로 제공되어, 토큰 압축과 멀티 모달 결합이 계산 효율성과 예측 정렬을 어떻게 달성하는지 파악할 수 있습니다. 특히 frame-level spatial token을 압축하는 수단과 각 모듈의 역할 분담이 명확히 표현되어 있습니다.
ViT 기반의 DeltaTok Encoder/Decoder 흐름을 표시한 블록 다이어그램으로, 시계열 입력과 재구성 손실 연결이 나타납니다.
Diagram이 그림은 DeltaTok 계열에서 ViT가 어떻게 연속 프레임의 embedding을 입력으로 받고 latent token을 생성·재구성하는지 입력→인코더→디코더→MSE 손실의 처리 선형을 통해 보여 줍니다. 구조상 과거 프레임과 현재 프레임의 token이 어떻게 병렬로 인코딩되어 다음 프레임을 예측하는지, 손실 신호가 어느 지점으로 흐르는지 한눈에 파악할 수 있습니다. 이는 delta token이 효율적 예측 단위로 작동하는 기술적 근거가 되어 줍니다.
근거
  • DeltaWorld는 Vision Foundation Model의 feature 차이를 Delta Token으로 압축해 multi-hypothesis 예측 비용을 크게 낮춘다. DeltaWorld 설명 및 기술적 수치(프레임당 1,024개 토큰을 하나의 Delta Token으로 압축) — 해당 문단과 이미지 출처

3D Trace와 Point Flow 기반 예측

로봇 조작에서는 전체 영상보다 물체와 End-Effector의 3차원 운동 정보가 더 직접적인 의사결정 자원일 수 있으므로 TraceGen과 PointWorld처럼 Task-스페이스를 예측 타깃으로 삼는 연구가 등장했습니다. TraceGen은 다양한 인간·로봇 비디오를 공통의 3D trace로 정규화해 Transferable Motion Prior를 학습하고, 소수의 데모로 새로운 로봇에 빠르게 적응하도록 설계되어 있습니다. PointWorld는 RGB-D와 액션 시퀀스에서 각 장면 포인트의 3D displacement를 예측해 Candidate Action을 Rollout하고 Goal에 가까운 변화를 만드는 액션을 선택하는 방식으로 Planning과 직접 연결되는 산출물을 생성한다는 점이 중요합니다.
TraceGen·Trace 기반 흐름과 3D 포인트 흐름을 사용한 조작 예측을 개념적으로 정리한 다이어그램입니다.
Diagram이 도식은 텍스트·비전 토큰·flow 기반 모델을 결합해 초기 노이즈에서부터 denoised trajectory를 생성하고 이를 3D로 역투영하여 조작 궤적을 얻는 전체 파이프라인을 보여 줍니다. 카메라 포즈와 센서 깊이 맵을 이용해 2D 키포인트 패치를 3D로 풀어내는 과정이 시각화되어 있어 Cross-Embodiment 데이터로부터 공통의 3D trace를 얻는 방법론적 증거를 제공합니다. 설계 상 flow 기반 모델이 어떻게 공간적 일관성을 만드는지 확인할 수 있습니다.

물리 기반 Latent Dynamics: ParticleGS

ParticleGS는 장면을 3D Gaussian 파티클 집합으로 분해하고 각 파티클에 대해 latent physical state를 부여한 뒤 Neural ODE 기반 evolver로 연속시간 동역학을 학습하는 접근을 제시합니다. 모델은 관측 비디오에서 물리적 상태 분해와 연속적 진화를 학습하여 관측 범위 바깥의 장기적 외삽을 안정적으로 수행하려는 목적을 가집니다. 이 방법은 단순 시각적 보간으로는 확보하기 어려운 conservation·contact·continuity 같은 dynamics 일관성을 롱호라이즌 예측에서 유지하는 것이 왜 중요한지를 근거와 함께 제시합니다.

Belief-Conditioned Simulation: Align While Search

Align While Search(AWS)는 전통적 Transition Model을 학습하지 않고, Frozen LLM을 Belief Updater와 Belief-Conditioned Approximate Simulator로 활용해 부분 관측 환경에서 정보 획득형 탐색 행동을 선택하는 방법입니다. 상위 수준의 자연어 가설로 잠재 환경 구조를 표현하고 하위 수준은 후보 위치 분포로 표현한 뒤, LLM으로 Posterior를 갱신하고 그 Belief를 조건으로 행동 결과 관측을 시뮬레이트하여 기대 정보 획득량을 근사합니다. 이 루프는 학습 데이터의 평균 탐색 궤적을 단순 반복하는 실패를 줄이고 현재 관측에 근거한 탐색을 유도한다는 점에서 Belief Inference와 Simulation을 행동 선택으로 연결하는 사례 증거를 제공합니다.
근거
  • AWS는 Frozen LLM을 Belief Updater와 Belief-Conditioned Simulator로 쓰고, 그 조건부 시뮬레이션을 통해 정보 획득형 탐색 행동을 선택한다. Align While Search 섹션의 알고리즘적 루프 서술 및 Belief 상위·하위 표현 구조 출처

PCB 설계 자동화와 PCBWorld

정밀 설계 도메인인 PCB에서는 픽셀이나 자연영상 기반 prior보다 Board Geometry, Netlist, Routing Topology 같은 구조적 상태 보존이 우선시됩니다. PCBWorld는 KiCad 엔진과 연동해 각 CAD operation의 정확한 One-Step 결과와 DRC를 얻을 수 있는 Engine-Grounded 환경을 제공하고, Learned Model은 많은 후보 액션의 장기적 완성 가능성(Completion Probability, Dead-End Risk, Residual Routability 등)을 빠르게 예측하는 Planning Surrogate로 사용되도록 설계됩니다. 이 사례는 World Model이 반드시 전체 미래 화면을 생성할 필요는 없으며, 설계 완성 가능성을 보존하는 구조적 예측이 검색·검증 절차에서 더 실용적일 수 있음을 보여주는 적용 증거입니다.
PCBWorld와 전체 3D scene simulation을 비교하는 결과 이미지로, 입력 장면과 출력 포인트 흐름을 함께 제시합니다.
Infographic이미지는 실제 로봇 환경에서 RGB-D 입력으로부터 생성된 전체 장면의 3D point flows를 출력해 조작 시뮬레이션으로 사용하는 예시를 보여 주며, PCBWorld의 Engine-Grounded 검증과 대비되는 대규모 scene modeling의 산출물을 함께 제시합니다. 이는 설계용 Engine-Grounded 환경과 자연환경 로봇 시뮬레이션이 요구하는 표현 수준의 차이를 시각적으로 드러내는 증거 역할을 합니다. 또한 구조적 상태 보존이 필요한 설계 도메인에서 어떤 정보가 우선시되는지 비교 근거를 제공합니다.

용어 해설

월드 모델(World Model)
현재까지의 관측과 행동을 요약한 상태로부터 미래의 환경 변화를 예측하는 모델군을 가리키며, 예측 대상은 영상, 잠재 표현, 궤적, 3D 기하 또는 물리 상태까지 다양합니다.
행동 제어형 비디오(Action-Controllable Video)
Agent나 사용자의 입력으로 특정 행동 시퀀스에 따른 미래 프레임을 생성하는 Video Generation 방식으로, 시각적 Rollout을 Learned Simulator로 직접 활용하는 목적에 초점이 맞춰집니다.
예측적 특징(Feature)(Predictive Feature)
원시 픽셀 대신 Vision Foundation Model에서 추출한 특성 공간에서 시간에 따른 의미적 변화를 예측하는 표현으로, Pixel-복원 비용을 줄이면서 downstream 과제에 직결되는 정보를 보존합니다.
3차원 트레이스(3D Trace)
조작 작업에서 물체와 End-Effector의 장면 중심 궤적을 3D 좌표계로 표현한 구조로, 카메라·외관 차이를 제거하고 조작에 필요한 기하학적 관계만을 유지합니다.
포인트 플로우(Point Flow)
장면의 3D 포인트 각각이 주어진 로봇 액션에 따라 이동하는 변위를 예측하는 표현으로, Embodiment에 독립적인 공간적 변화 예측을 통해 Planning에 직접 연결됩니다.
믿음조건(베이리프) 시뮬레이션(Belief-Conditioned Simulation)
부분 관측 환경에서 관측 이력으로 갱신한 잠재 구조(Belief)를 조건으로 두고 LLM 같은 모델로 행동 결과 관측을 근사적으로 생성하여 정보 획득형 행동을 선택하는 방법입니다.

기술

  • Vision Foundation Model
  • Neural ODE
  • KiCad
  • LLM
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 05.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.