본문으로 건너뛰기

Valdi: 가치 확산 월드 모델(Value Diffusion World Models)

잠재 기반 월드 모델은 실시간 Model Predictive Control에 필요한 저지연 예측을 제공하면서도 불확실한 미래를 표현할 수 있어야 한다. Valdi는 잠재 공간에서 확산 모델을 동적으로 학습해 가치와 보상을 함께 예측하는 구조를 온라인 플래닝 루프에 결합함으로써 이 두 요구를 동시에 충족하는 방안을 제시했다. 단일 확산 단계만으로도 결정론적 MLP 기반 대비 동등한 제어 성능을 얻는 점이 실시간 플래닝에서 확산 모델의 실용성을 시사한다.

용어 해설

잠재 확산 모델(Latent Diffusion)
관측 픽셀 대신 저차원 잠재공간에서 확산 프로세스를 수행하는 생성 모델이다. 입력 잠재에 노이즈를 점진적으로 추가한 뒤 역과정을 통해 노이즈를 제거하며 샘플을 생성한다. 본 논문에서는 잠재 경로 전체를 동시 생성하여 계산 효율을 확보하고 불확실한 미래를 표현하는 데 사용되었다.
Temporal-Difference Model Predictive Control(TD-MPC)
잠재 공간에서의 온라인 플래닝을 위해 가치 예측과 일시적 차분 손실을 결합한 방법론이다. 관측을 인코더로 잠재로 변환하고, 단일 단계 전이 모델로 롤아웃하여 CEM 같은 최적화기로 행동을 선택한다. Valdi는 이 구조를 따르되 확산 기반 dynamics로 전이 모델을 대체하여 불확실성 표현을 추가했다.
모델 예측 제어(Model Predictive Control)
현재 상태에서 미래 행동 시퀀스를 시뮬레이션해 기대 보상을 최대화하는 온라인 최적화 방식의 제어 기법이다. 각 플래닝 사이클에서 최적의 행동 시퀀스 중 첫 행동만 실행하고 다시 플래닝을 수행한다. 실시간 제어에서는 롤아웃 속도와 모델의 표현 능력 간 균형이 핵심 제약이다.
Learned Perceptual Image Patch Similarity(LPIPS)
디코더가 생성한 이미지들 사이의 지각적 다양성을 측정하는 기준으로, 고수준 특징 공간에서 쌍별 거리의 평균을 계산한다. 값이 클수록 시각적으로 서로 다른 모드가 많이 생성되었음을 의미한다. 본 논문에서는 N=100 샘플의 평균 쌍별 LPIPS를 예측 다양성 지표로 사용했다.
교차 엔트로피 방법(Cross Entropy Method)
확률적 최적화 기법으로 행동 시퀀스 분포를 반복적으로 재샘플링하고 상위 해들을 사용해 분포 파라미터를 갱신한다. 플래닝 맥락에서는 후보 행동을 평가해 상위 집합의 평균으로 다음 샘플링 분포를 형성한다. Valdi는 CEM을 사용해 확산으로 생성한 잠재 경로의 가치 합을 최대화하는 행동을 탐색했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 01.수집 2026. 07. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.