TL;DR
대형 시각적 월드 모델이 생성하는 미래 예측이 시각적으로 그럴듯해도 실제 동적 행동과 어긋나면 제어 결정에 치명적인 오류가 발생한다. 이 논문은 그러한 환각이 구조적 결함이 아니라 데이터 커버리지 부족에서 기인한다는 사실을 밝혀내고, 데이터 분석 신호를 이용해 환각을 런타임에 감지하고 표적 수집으로 빠르게 보완하는 절차를 제시했다. 결과적으로 적은 양의 추가 실제 궤적만으로도 사전학습된 모델을 미지 환경에 효율적으로 적응시킬 수 있음을 보였다.
왜 중요한가
대형 시각적 월드 모델이 생성하는 미래 예측이 시각적으로 그럴듯해도 실제 동적 행동과 어긋나면 제어 결정에 치명적인 오류가 발생한다. 이 논문은 그러한 환각이 구조적 결함이 아니라 데이터 커버리지 부족에서 기인한다는 사실을 밝혀내고, 데이터 분석 신호를 이용해 환각을 런타임에 감지하고 표적 수집으로 빠르게 보완하는 절차를 제시했다. 결과적으로 적은 양의 추가 실제 궤적만으로도 사전학습된 모델을 미지 환경에 효율적으로 적응시킬 수 있음을 보였다.
핵심 기여
MMBench2: 행동·보상 레이블을 포함한 대규모 비주얼 월드 모델 데이터셋
MMBench2는 210개 작업, 총 65,600개 트래젝토리(427시간, 224×224, 15fps, 약 23M 프레임)를 포함하는 멀티태스크 데이터셋이다. 각 트래젝토리는 그라운드트루스 행동과 보상을 포함하며 200개 작업은 사전학습용으로, 10개는 완전 미지 전이 평가용으로 분리되어 있다. 이 데이터는 다양한 작업 도메인과 행동 분포를 포괄하여 월드 모델의 커버리지 분석과 온라인 상호작용 실험에 필요한 제어와 측정을 가능하게 한다.
환각의 단계별 분류: perceptual, action-marginalized, scene-diverging
환각을 인코더-디코더의 재구성 오류, 액션에 둔감해지는 전이, 다중스텝 롤아웃에서 물리적으로 비현실적으로 분기되는 현상으로 각각 규정했다. 각 모드는 월드 모델 파이프라인의 서로 다른 구성요소(tokenizer, dynamics, rollout)에 기인하며 서로 다른 진단 신호로 포착된다. 이 분류는 어떤 단계에서 실패가 시작되는지 판별해야 효과적으로 보완할 수 있다는 실험적 근거를 제공한다.
라벨 없이 동작하는 세 가지 환각 예측자 제안
토크나이저 라운드트립 잔차(tokenizer round-trip residual), 흐름 불안정성(flow instability), 시드간 디노이징 분산(inter-seed denoising variance)을 제안했다. 각 지표는 입력값만으로 계산되며 레이블이나 추가 학습이 필요하지 않아 런타임 탐지와 온라인 데이터 수집 목적에 적합하다. 이들 지표는 정규화된 형태(u_norm)를 적용하면 장면 동적성의 혼동을 줄여 환각 예측 성능이 향상되는 것으로 나타났다.
커버리지 인식 샘플링과 예측기 기반 표적 데이터 수집으로 환각 완화
사전학습 중 샘플링을 태스크 균일으로 재조정하는 coverage-aware sampling이 토크나이저 및 dynamics 지표를 동시에 개선했다. 온라인에서는 예측기를 호기심 보상으로 사용해 예측된 환각 점수를 기준으로 가장 정보가 많은 트래젝토리를 환경에서 수집했다. 이 조합은 미지 작업에 대해 50개 트래젝토리만으로도 사전학습 모델을 효과적으로 적응시켜 downstream 계획 성능을 크게 향상시켰다.
실험적 증거: 제안 지표의 강한 상관관계 및 적은 데이터로의 전이 개선
세 예측자는 롤아웃 ΔPSNR 대비 Spearman 상관계수 ρ≈0.80을 보이며 동일한 오류를 추적했다. coverage-aware training에서 토크나이저·다이나믹스를 모두 재학습했을 때 롤아웃 ΔPSNR이 최대 +0.88 dB 개선되었고 u_r^norm, u_f^norm, u_s^norm이 각각 -0.20, -0.07, -0.14로 감소했다. 표적 수집 실험에서 human/expert로 수집한 50 트래젝토리와 비교해 유사한 성능을 보이는 경우가 관찰되어 데이터 효율적 적응이 가능함을 입증했다.
핵심 아이디어 이해하기
월드 모델은 관찰을 잠재로 인코딩하는 토크나이저, 행동 조건화된 dynamics 예측기, 그리고 잠재를 다시 픽셀로 변환하는 디코더로 구성된 연쇄적 함수이다. 각 단계는 유한한 상태-행동 샘플로 학습되므로 관찰 분포의 외곽 영역을 요청받으면 단계별로 서로 다른 방식의 오류를 일으킬 수 있다. 따라서 환각은 단순히 파라미터 부족이나 아키텍처 문제만이 아니라 데이터 커버리지의 기능적 결과로 이해해야 한다.
방법론
전체 접근은 세 축으로 구성된다: 대규모 멀티태스크 데이터셋 구축, 350M 파라미터 수준의 Dreamer 4风 구조 학습, 그리고 라벨 없이 계산 가능한 환각 예측 지표를 이용한 훈련 및 수집 개입이다. 토크나이저는 symmetric encoder-decoder Transformer로 설계되며 패치화(stride 14)된 224×224 프레임을 64×64 차원의 잠재로 투사한다. dynamics는 block-causal Transformer로 32개의 공간 잠재, 행동 토큰, 레지스터 토큰을 시퀀스로 입력받고 shortcut flow-matching 목표로 학습되어 추론 시 4개의 Euler 서브스텝으로 다음 프레임 샘플링이 가능하다.
주요 결과
제안한 세 예측자는 open-loop 롤아웃 ΔPSNR과의 Spearman 상관계수에서 약 ρ≈0.80을 기록하여 높은 예측력을 보였다. coverage-aware training을 토크나이저와 dynamics 모두에 적용했을 때 롤아웃 ΔPSNR이 +0.88 dB로 최대 개선되었고 u_r^norm, u_f^norm, u_s^norm이 각각 −0.20, −0.07, −0.14로 감소했다. 표적 데이터 수집 실험에서 human play와 expert 수집은 미지 작업에서 평균 정상화 성능 0.362를 달성했으며 u_r^norm 기반 curiosity로 50개 트래젝토리 수집 시 성능 0.325를 기록해 제한된 데이터로도 상당한 성능 향상을 얻을 수 있음을 보였다.
기술 상세
아키텍처는 세 부분으로 분리된다: 50M 파라미터의 encoder, 50M 파라미터의 decoder, 그리고 250M 파라미터의 block-causal Transformer dynamics로 총 약 350M 파라미터다. 토크나이저는 패치화(stride 14)로 프레임을 분할하고 64개의 learnable latent queries를 포함하여 출력 잠재 z∈[−1,1]^{64×64}를 생성한다. dynamics의 입력은 행동 토큰(16차원 패딩, 2-layer MLP), shortcut-conditioning 토큰(σ와 step size 인코딩), 32 packed spatial latents, 4 register tokens 등으로 구성되며 flow-matching 목표로 학습된다.
한계점
연구는 350M 파라미터 규모와 시뮬레이션 기반의 210개 작업에 국한되어 있어 수십억 파라미터급 모델이나 실제 로봇 센서 노이즈가 있는 데이터에 그대로 일반화된다고 단정할 수 없다. 또한 월드 모델 학습과 실험에는 상당한 계산 자원이 필요하며 이는 실무 적용의 제약 요인으로 남는다. 논문 자체에서 더 많은 환경 다양성과 실제 데이터에 대한 추가 검증이 필요함을 명시하고 있다.
실무 활용
사전학습된 시각적 월드 모델을 실제 작업에 맞춰 빠르게 적응시킬 때 표적 수집과 커버리지 기반 재샘플링이 실용적 접근이다. 특히 미지 작업에 대해 수십 개의 실제 궤적만 추가 수집하면 계획 성능이 크게 향상되어 실무에서 데이터 효율적 적응 파이프라인으로 활용 가능하다. 공개된 코드와 데이터셋은 재현성과 적용을 용이하게 한다.
- 로봇 시뮬레이션 기반 연구에서 특정 조작 작업에 대해 50개 내외의 실제 트래젝토리를 수집하여 사전학습 모델의 시뮬레이션-현실 전이를 개선할 수 있다.
- 대규모 멀티태스크 월드 모델을 사전학습할 때 태스크 균일 샘플링으로 저표본 작업의 환각을 줄이고 전반적 롤아웃 품질을 개선할 수 있다.
- 온라인 운영 환경에서 환각 예측기를 호기심 보상으로 사용해 실시간으로 정보량이 높은 상태-행동을 선별적으로 수집하는 폐쇄루프 데이터 증대 파이프라인에 적용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- State-Action Space
- — 에이전트의 관찰(상태)와 해당 시점에 취할 수 있는 행동을 결합한 공간이다. 이 논문에서는 각 지점의 데이터 충실도가 학습된 모델의 예측 정확도에 직접적인 영향을 미치며 환각이 주로 저커버리지 영역에서 발생한다고 규명되었다. 따라서 커버리지를 측정하고 보완하는 것이 모델 신뢰도 개선의 핵심 수단이 된다.
- Tokenizer Round-Trip Residual
- — 디코더로 생성한 프레임을 다시 인코딩했을 때 원래 예측된 잠재벡터와의 차이로 정의되는 지표이다. 계산 방식은 예측 잠재 ẑ를 Decode(ẑ)하여 재인코딩한 값과 비교하는 벡터 차이의 노름으로, 큰 값은 인코딩-디코딩 사슬에서 입력과 다른 구조적 재구성이 일어났음을 나타낸다. 이 지표는 토크나이저 수준의 지각적 환각을 탐지하는 데 직접적으로 사용된다.
- Flow Instability
- — dynamics 모델의 denoiser가 Euler 서브스텝 사이에서 수렴하지 않고 진동할 때 측정되는 지표이다. 구체적으로는 후반 절반의 서브스텝에서 clean-target 예측이 얼마나 크게 움직이는지 평균해서 계산하며, 값이 클수록 조건화가 약하거나 불안정한 상태임을 의미한다. 이 값은 action-conditional 전이의 불확실성과 연결되어 action-marginalized 환각을 포착한다.
- Inter-Seed Denoising Variance
- — 동일한 과거와 행동 조건에서 서로 다른 노이즈 시드를 사용해 N번 디노이징을 수행했을 때 다음 잠재 예측들 간의 분산이다. 입력으로 과거-행동을 받고 여러 시드로 독립 디노이징을 수행하면 분산이 계산되고, 높은 분산은 다중스텝 롤아웃에서 갈라짐(scene-diverging)을 예고한다. 이 지표는 에피스테믹 불확실성을 반영한다.
- Coverage-Aware Sampling
- — 훈련 데이터 샘플링을 프레임 단위가 아니라 태스크 또는 상태-행동 영역 단위로 재가중치하여 저표본 영역의 비중을 높이는 방식이다. 논문에서는 태스크 균일 샘플링을 적용해 토크나이저와 dynamics 모델 모두에서 환각 예측 지표가 개선되는 것을 확인했다. 이 방법은 같은 데이터로 아키텍처 변경 없이 환각을 줄이는 데이터 중심 개입이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.