본문으로 건너뛰기

WRBench: viewpoint 조건부 월드-스테이트 벤치마크를 통한 동적 세계 모델의 엔드포인트 지속성 진단

월드 모델이 진정으로 환경의 상태를 시간에 걸쳐 연속적으로 유지하는지 여부가 AGI 도달의 핵심이다.现행 벤치마크는 화질, 모션, 카메라 제어 등 표면 특성에 의존해 왔으며, 시야에서 벗어난 상태에서 월드가 여전히 진화하는지 여부를 평가하지 않는다. WRBench는 카메라 움직임을 관찰 가능성에 대한 개입으로 간주하고, 카메라가 보이지 않는 구간에서 월드 상태가 엔드포인트까지 일관되게 유지되는지를 검사한다.

왜 중요한가

월드 모델이 진정으로 환경의 상태를 시간에 걸쳐 연속적으로 유지하는지 여부가 AGI 도달의 핵심이다.现행 벤치마크는 화질, 모션, 카메라 제어 등 표면 특성에 의존해 왔으며, 시야에서 벗어난 상태에서 월드가 여전히 진화하는지 여부를 평가하지 않는다. WRBench는 카메라 움직임을 관찰 가능성에 대한 개입으로 간주하고, 카메라가 보이지 않는 구간에서 월드 상태가 엔드포인트까지 일관되게 유지되는지를 검사한다.

핵심 기여

Viewpoint-conditioned world-state benchmark

카메라 시점 변화에 따른 세계 상태의 엔드포인트 일관성을 평가하는 진단형 벤치마크 WRBench를 제안한다. Natural-25 프롬프트 패밀리와 이벤트-뷰 기록 체계를 활용하여, 시작 프레임의 초기 상태에서 카메라가 벗어나고 돌아오는 상황에서 엔드포인트의 일치 여부를 측정한다.

WRBenchLib 및 인간 검증 기반 도구

WRBenchLib를 통해 각 모델에 대한 생성 입력, 제공된 입력, 생성 영상, 프로VENANCE를 표준화된 포맷으로 기록한다. 또한 2,547건의 중복 제거된 인간 주관 판정으로 자동 평가기를 보정한다.

Directional diagnosis로 엔드포인트-존재성 분리

엔드포인트 지속성은 시각적 품질, 재관측 접근성, 재관측 일관성과 별개로 평가되어야 함을 보인다. 시각적 품질과 접근성은 엔드포인트의 재관측 여부를 예측하지 못하며, 엔드포인트 자체를 유지하는 능력은 추가적 학습 신호와 아키텍처 설계가 필요하다.

여러 Paradigm에서의 계측 및 가이드라인

소스-비디오, 기하-캐시, 모델-추론, 프롬프트-전용의 4가지 컨트롤 패러다임에서 재관측 가능성 및 엔드포인트 일관성을 분리해 측정한다. 이를 통해 각 패러다임이 어떤 한계를 가져오는지 구분하고, 엔드포인트 유지에 기여하는 요소를 구체화한다.

What-memory 관점의 향후 방향 제시

엔드포인트 지속성은 단순한 이미지 품질의 향상으로 해결되지 않으며, what-memory를 학습 신호로 포함한 설계가 필요함을 제시한다. 장기-단기 메모리 축적 및 엔드포인트를 상태로 기록하는 방향의 연구가 필요하다고 제안한다.

핵심 아이디어 이해하기

출발점과 한계: 세계 모델은 시계열에서 월드 상태가 지속적으로 진화해야 한다. 이를 위해서는 관찰에 의존하지 않는 내부 상태(core state)가 필요하다. 기존 벤치마크는 표현력과 카메라 제어를 중시하지만, 카메라가 벗어났을 때 월드가 어떻게 변화하는지의 엔드포인트를 확인하지 못한다. WRBench는 viewpoint intervention으로 관찰 가능성을 변경하고, 카메라가 다시 돌아왔을 때 목표 객체가 이벤트의 엔드포인트를 유지하는지 평가한다. 해결 원리: 여섯 가지 차원의 진단 체계(i: Requested-camera precision, ii: Prompt-camera alignment, iii: Visual integrity, iv: Visible spatial/state consistency, v: Re-observation support, vi: Re-observed spatial/state consistency)를 도입해 제시된 이벤트-월드 간의 연결고리를 단계적으로 검증한다. 정밀한 진단 체계는 카메라 제어가 단순한 렌더링이 아니라 월드 상태의 엔드포인트를 보존하도록 하는지의 여부를 분리된 지표로 드러낸다. 달라지는 점: 모델의 스케일링이나 파라미터 증가가 재관측 접근성은 개선해도 엔드포인트 지속성에는 한계가 있음이 반복적으로 관찰된다. Wan 계열의 확장은 재관측 접근성을 높이지만 재관측 상태 일관성은 여전히 한계에 머물며, 엔드포인트를 기록하는 state carrier의 설계가 필요하다는 결론을 강화한다.

방법론

전체 접근 방식과 핵심 아이디어: WRBench는 Natural-25 프롬프트 스위트를 기반으로 이벤트(substate)와 viewpoint intervention을 정의하고, WRBenchLib는 각 모델의 입력-출력-프로브를 포괄적으로 기록한다. 입력 → 처리 → 결과의 순서로 계산 흐름을 설명한다. 입력은 x_i^0(초기 관찰), e_i(지정된 이벤트), τ_i(의도된 시점), ν_i(가시성), π_i(프롬프트/인터페이스)를 포함하는 event-view record를 형성하며, z_{i,m} = Φ_m(r_i)로 m 모델의 입력으로 변환된다. 처리 단계에서 각 모델은 카메라 경로에 따라 ca m(input)을 수행하고, 생성 영상 v_{i,m}와 provenance η_{i,m}를 산출한다. 평가 측정은 여섯 차원의 점수로 이루어지며, 각 차원은 독립적으로 산출되어 합산되지 않는다. 수식적 원리로는(1) p_yes ∣ v,c = exp(L_yes)/[exp(L_yes) + exp(L_no)]의 형태로 yes/no 프로브의 확률을 구하고, (2) M_a(v,c) = (1/|P_a^+|+|P_a^-|) * ∑ e_a(q,v,c)로 각 차원의 프로브를 요약한다. 이때 e_a(q,v,c) = p_yes(q|v,c)로 양성 프로브, 1 - p_yes(q|v,c)로 음성 프로브를 정의한다. 제도화된 차원들은 (i) Cam Prec., (ii) Cam Align., (iii) Integ. (visual integrity), (iv) Vis. spatial/state, (v) Reobs. support, (vi) Reobs. spatial/state로 구분되며, (v)와 (vi)는 judgeable return evidence가 확보된 경우에만 계산된다. Open-world PROMPT-품질 외의 추가 평가: Human Preference Calibration으로 2,547명의 판정으로 자동 평가기의 축척치를 보정한다. WRBenchLib는 각 모델 m에 대해 Φ_m(r_i) = (u_{i,m}, d_{i,m}, v_{i,m}, η_{i,m})를 산출하고, 이를 통해 모델 간 비교가 증거 기반으로 이루어지게 한다. 모델-패러다임별 차이를 분석하기 위해 4가지 viewpoint condition type(Source-video, Geometry-cache, Model-inferred, Prompt-only)별로 Reobs. support 및 재관측 상태 일관성의 프런티어를 비교한다. 구현 및 학습 세부: 시나리오는 25개의 scene family를 cross하고, 이벤트 설계는 공간 이동과 상태 변화의 4단계를 포함하는 Natural-25를 사용한다. 시각적 무결성은 DINOv2 기반 proxy로 프레임 간의 전역/로컬 일관성을 측정한다. 평가 모듈은 Qwen-3.5-9B를 이용한 질의-응답 프로브와 Qwen-3-VL-Instruct-8B를 통한 judgeability 판단으로 구분된다. 결과의 집계는 Denominator를 차원별로 다르게 적용하되, (v) 재관측 테스트의 적용 여부는 judgeability 여부에 의존한다. 제약 및 한계: 시나리오의 한계로 Natural-25의 범위 및 judgeability가 모든 영상에서 균등하게 확보되지 않을 수 있으며, 엔드포인트를 직접적으로 학습시키는 공개 신호가 아직 없으므로 엔드포인트 지속성은 아키텍처/학습 신호의 설계에 의존한다.

관련 Figure

WRBench의 인터랙티브 월드-월드 개요 다이어그램.
Diagram

다이어그램은 Natural-25 프롬프트, WRBenchLib, 6차원 평가 체계의 흐름을 연결한다. 이 도식은 프롬프트-인터랙션이 월드-케이스에 어떤 방식으로 연결되는지 보여주며, 엔드포인트 지속성 평가의 논리적 흐름을 보완한다.

WRBench의 인터랙티브 월드-월드 개요 다이어그램.

WRBench 파이프라인의 데이터 흐름과 평가 체계의 구성도
Diagram

다이어그램은 Natural-25 프롬프트-랜드마크 및 평가 파이프라인의 구조를 시각화한다. WRBenchLib의 입력-출력 기록과 여섯 차원의 진단 지표가 어떻게 연결되는지 보여준다.

WRBench 파이프라인의 데이터 흐름과 평가 체계의 구성도

six-dimension 평가 체계의 개념도
Chart

6개의 진단 차원은 모델별로 독립적으로 산정되며, 재관측 테스트의 적용 여부는 judgeability에 달려 있음을 시각화한다. 이 도식은 엔드포인트 지속성의 다면적 평가를 설명한다.

six-dimension 평가 체계의 개념도

Wan-Fun 계열의 시각적/상태 지표 변화
Chart

스케일링/버전 업이 시각적 품질과 접근성에는 기여하지만, 엔드포인트 지속성에 미치는 영향은 제한적임을 시사한다. 이는 what-memory 설계 필요성을 뒷받침한다.

Wan-Fun 계열의 시각적/상태 지표 변화

케이스 방향성에 따른 재관측 접근성 차이(카메라 방향에 따른 차이)
Photo

카메라 방향에 따라 재관측이 가능해지는 비율이 크게 달라진다는 것을 보여준다. 이는 카메라 채널이 엔드포인트 평가의 가능 여부를 좌우함을 시사한다.

케이스 방향성에 따른 재관측 접근성 차이(카메라 방향에 따른 차이)

주요 결과

주요 벤치마크 결과: WRBench는 23개 모델, 9,600개의 영상으로 구성되며, 6개의 진단 차원을 통해 시나리오-카메라 간섭에서의 엔드포인트 지속성을 진단한다. 공통 결론은 컨트롤 가능한 비주얼 품질, 재관측 접근성, 재관측 일관성이 서로 다른 축으로 작동하며, 현재의 규모나 아키텍처로는 엔드포인트 지속성(endpoint persistence)을 보장하지 못한다. Finding 3~6에 걸쳐, Paradigm별 접근성은 증가하나 엔드포인트 지속성은 크게 개선되지 않으며, 엔드포인트를 기록하는 state carrier의 설계가 핵심 제약임이 드러난다. Wan 계열에서 파라미터 규모를 1.3B에서 14B로 확장해도 재관찰 상태는 0.62로 낮아지거나 비슷하게 유지되었고, Lingbot-World는 Vis. Spatial 0.874, Vis. State 0.719 등 비교적 높은 시각적 일관성과 상태 일관성을 보였으나 엔드포인트 재관찰은 여전히 0.62 수준으로 남아 있었다. 이러한 결과는 더 큰 파라미터 수나 단순한 렌더링 품질 향상만으로는 월드-상태의 지속적 진화를 확보하기 어렵고, 엔드포인트를 '상태'로 기록하는 what-memory 차원의 설계가 필요함을 시사한다. Paradigm 간 차이도 엔드포인트 지속성보다는 접근성에 더 큰 영향을 주며, 카메라 채널의 제어 방식이 재관측 가능성에 더 큰 영향을 미친다. Table 2/3/4의 사례 분석에서 geometry-cache, source-video가 가장 높은 재관측 접근성을 보이나 재관측 상태의 점수는 여전히 한정적이다. Finding 1에 따르면, 시각적 무결성이나 재관측 접근성은 return 여부의 판단에는 기여하나, 재관측 상태의 정확한 점수와 엔드포인트의 일관성 간의 상관관계는 낮다. Finding 5-6은 엔드포인트 지속성의 확보를 위한 state의 저장/전달 기제의 필요성을 지적한다. 결론적으로 WRBench는 동적 월드-생성 모델의 평가에서 엔드포인트 지속성, 즉 이벤트 엔드포인트를 월드에 기록하는 능력이 핵심 제약임을 명확히 한다.

관련 Figure

Model별 WRBench 진단 프로파일 표
Chart

패러다임별로 재관측 접근성 및 재관측 상태 일관성의 차이를 보여준다. 각 모델군이 카메라 컨트롤 인터페이스에서 얻는 접근성과 엔드포인트 지속성 간의 관계를 확인할 수 있다.

Model별 WRBench 진단 프로파일 표

엔드포인트 지속성의 이벤트-요인 분해 차트
Diagram

이 차트는 이벤트 이동 vs 상태 변화의 각 축이 재관측 및 재관측 상태에 미치는 영향을 2×2 디자인으로 분해한다. 이는 In-place 변화가 엔드포인트 지속성에 더 큰 부담을 준다는 것을 보여준다.

엔드포인트 지속성의 이벤트-요인 분해 차트

기술 상세

아키텍처 및 수학적 기초: WRBench의 전체 파이프라인은 (i) Natural-25 프롬프트 스위트, (ii) WRBenchLib 입력-출력 포맷, (iii) 6차원 평가 체계, (iv) 인간 주관 보정으로 구성된다. 학습 및 평가의 수학적 기초는 다음과 같다. 입력 레코드 r_i = (x_i^0, e_i, τ_i, ν_i, π_i)이며, 각 모델 m에 대해 z_{i,m} = Φ_m(r_i)로 입력이 매핑된다. 평가 지표는 6개의 차원으로 정의되며, 각 차원은 독립적으로 산정한다. (i) Cam Prec.: 카메라 경로의 명령 정확도는 영상에서 요청된 viewpoint 경로를 따르는지로 판단한다. (ii) Cam Align.: 프롬프트-단위 또는 API 인터페이스에서 공용-Yaw 의도에 부합하는지 판단한다. (iii) Visual integrity: 프레임 증거의 신뢰성(I_vis)과 프레임 간 구조 보존을 측정한다. (iv) Visible spatial/state: 이벤트 진행 중 시각적 위치 관계 및 상태가 일치하는지 yes/no 프롭브로 판단하고, e_a(q,v,c)로 각 프롱브의 확률 p_yes를 구한다. (v) Re-observation support: 은시점에서 재관측이 가능한지 판단한다. (vi) Re-observed spatial/state: judgeable 재관측 증거가 확보되면, 재관측 시점의 공간/상태 일관성을 측정한다. p_yes를 사용한 확률 계산은 L_yes, L_no를 통해 로그-합-지수 형태로 도출되며, 각 차원의 e_a(q,v,c) 값의 평균을 통해 최종 M_a(v,c)를 얻는다. 이때 v는 생성 영상, c는 컨텍스트를 나타낸다. Human calibration으로 차원별 AC1, κ, α를 산출하고, 차원별 평가를 독립적으로 보고한다.

한계점

WRBench의 한계점은 Natural-25 프롬프트 스위트의 한정된 시나리오 커버리지와 judgeability의 의존성이다. 또한 엔드포인트를 직접 학습 신호로 쓰는 공개된 학습 신호가 부족하고, 특정 프롬프트-인터페이스에서 재관측 가능성을 높이는 전략이 항상 엔드포인트 일관성으로 직결되지는 않는다. 이로 인해 현재 벤치마크는 엔드포인트 지속성의 한계와 상호작용의 복합적 특성을 완전하게 포착하지 못한다.

실무 활용

실무에서의 직접적 적용 가능성은 제한적이다. WRBench의 진단 프로토콜은 월드 모델의 설계 및 평가 루프에 도입되어 모델 개발 시 엔드포인트 지속성(target persistence) 향상을 위한 설계 요소를 구체화하는 데 사용될 수 있다.

  • 동적 월드 생성 파이프라인에서 엔드포인트 지속성을 목표로 하는 모델 평가 및 비교
  • 상태 캐리어(state carrier) 설계 및 학습 시나리오에 대한 체크리스트 도구로 활용
  • 다중-뷰 시나리오에서 엔드포인트 교육 신호의 필요성 확인 및 보정
  • 프로그래밍-인터페이스 수준에서 재관측 가능성 및 엔드포인트 일관성의 분리된 지표를 도입하는 벤치마크 설계

코드 공개 여부: 미확인

키워드

world models(월드 모델)WRBenchviewpoint intervention(시점 개입)world-state persistence(월드 상태 지속성)Natural-25RAGstate carriermulti-modal
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 18.수집 2026. 06. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.