본문으로 건너뛰기

HOLO-WORLD: Unified camera, object and weather control for video world model

영상 세계 모델에서 카메라/객체 제어와 환경 상태를 하나의 인터페이스로 다루는 일은 데이터와 모델 정렬의 난제로 남아 있다. 본 논문은 HoloStateData로 unified 제어 신호를 수집하고, UniSA와 Scene-Weather Decomposed CFG를 통해 세계 보존과 날씨 전이 잔차를 분리 학습·샘플링함으로써 소스 세계의 구조를 유지하면서 다양한 날씨 상태로의 전이가 가능해진다. 이로써 비디오-투-비디오 편집 기반의 날씨 편집 대비 단일 프레임에서의 1-shot 학습으로도 높은 품질의 날씨 변환과 카메라/객체 제어 일관성을 달성한다.

왜 중요한가

영상 세계 모델에서 카메라/객체 제어와 환경 상태를 하나의 인터페이스로 다루는 일은 데이터와 모델 정렬의 난제로 남아 있다. 본 논문은 HoloStateData로 unified 제어 신호를 수집하고, UniSA와 Scene-Weather Decomposed CFG를 통해 세계 보존과 날씨 전이 잔차를 분리 학습·샘플링함으로써 소스 세계의 구조를 유지하면서 다양한 날씨 상태로의 전이가 가능해진다. 이로써 비디오-투-비디오 편집 기반의 날씨 편집 대비 단일 프레임에서의 1-shot 학습으로도 높은 품질의 날씨 변환과 카메라/객체 제어 일관성을 달성한다.

핵심 기여

Unified state control for video world models

단일 이미지에서 카메라/객체 제어와 날씨 전이를 하나의 인터페이스로 수행하는 통합적인 영상 세계 모델의 설계

HoloStateData

현실 비디오, 페어링된 시뮬레이션 날씨 비디오, 날씨 전이 비디오를 카메라 포즈/geometry anchors/객체 제어/장면 텍스트/날씨 상태 supervision으로 정렬하는 state-간 샘플링 데이터셋

Unified Scene Adapter (UniSA)

World Adapter와 State Adapter로 잔차를 분리 학습시키고, 동일한 Wan 백본에서 월드 보존과 날씨 전이를 각각 다른 잔차 공간으로 주입하는 모듈

Scene-Weather Decomposed CFG

샘플링 시 장면 잔차와 날씨 잔차를 독립적으로 가이드하는 CFG 분해로, 날씨 효과를 강화하되 전체 조건의 과잉 증폭을 방지

실험적으로 V2V 편집 baselines를 능가

Weather 전이에서 Weather Alignment 및 VLM Evaluation에서 우수한 성능을 보이고 Real subset의 카메라/객체 제어 정확도도 향상

데이터/실험 규모 명시

HoloStateData는 15K 학습 샘플, 벤치마크는 Real/Simulation/V2V 각 50샘플로 구성되며 Wan2.1-T2V-14B 백본 위에서 학습

핵심 아이디어 이해하기

단락 1: 영상 세계 모델은 관찰 가능한 월드의 변화를 예측하는 것인데, 혼합된 제어 신호(카메라 포즈/배경 구조/객체 동작)와 환경 상태(날씨)를 함께 다루면 잔차가 서로 간섭하고 품질이 저하된다. 기존 방법은 카메라/객체 제어와 날씨 편집을 분리하거나 비디오-투-비디오 편집에 의존해 단일 이미지에서의 제어가 약했다. 이 문제를 기초 개념으로 정의한다.

방법론

단일 프레임에서 Observed World를 보존하기 위한 Cworld와 Weather 상태를 위한 Cstate를 분리된 텍스트 조건으로 입력받고, 이를 Wan 백본에 주입한다. UniSA는 World Adapter와 State Adapter의 두 잔차 공간을 통해 동일 백본에서 서로 다른 잔차를 학습하며, λw와 λs가 잔차의 스케일을 조절한다. Scene-Weather Decomposed CFG는 sampling 시 v∅, vscene, vfull의 세 예측을 통해 scene 잔차와 weather 잔차를 분리하여 가이던스를 조합한다.

주요 결과

Real subset에서 BBench-I2V 및 카메라/객체 제어 지표가 높고 RotErr가 0.719로 최저를 기록했다. Weather subset에서 Weather Alignment 86.00%, VLM Evaluation 68.51을 달성했고, Human User Study에서 Cosmos-Transfer2.5 대비 83.00%를, Wan2.7-Edit 대비 62.00%를 얻었다. SW-CFG를 추가하면 Weather Alignment과 VLM Evaluation이 크게 향상되며, background preservation 지표도 유지된다. ablation 결과는 G-buffer, UniSA, SW-CFG의 조합이 최적의 성능을 낸다.

기술 상세

전체 아키텍처는 UniSA가 Wan2.1-T2V-14B 백본에 잔차를 주입하도록 구성된다. L = {0, 5, 10, 15, 20, 25}의 DiT 층에서 World Adapter와 State Adapter를 통해 각각 잔차를 추가하고, 월드 잔차 λw는 1로 고정하며 상태 잔차 λs는 weather prompt의 여부에 따라 0/1로 설정한다. 학습은 VAE, 텍스트 인코더, Wan 백본은 고정되고 World/State Adapter만 학습한다. 손실은 Wan Flow를 목표로 하는 Lflow를 사용하며, Cworld = {Rrgb, Rdepth, Rnormal, Cbbox}, Cstate = {Rrgb}로 정의된다. SW-CFG는 v∅, vscene, vfull의 세 예측을 기반으로 scene residual ∆scene = vscene − v∅과 weather residual ∆weather = vfull − vscene를 정의하고, v̂ = v∅ + sscene∆scene + sweather∆weather의 형태로 가이던스를 분리한다. 학습 데이터는 Real, Simulation, V2V의 세 서브셋으로 구성되며, Real은 비편집 월드 보존을, Simulation/V2V는 날씨 전이를 학습에 반영한다. 81프레임 RGB/깊이/노멀 기반의 소스 컨트롤 렌더링은 소스 월드의 구조를 고정하고 날씨 프롬프트만 타겟으로 학습한다.

한계점

본 방법의 초점은 단일 이미지로부터의 controllable video generation이며, 실제 물리 시뮬레이션 전체를 대체하는 범위는 아니다. 날씨 잔차의 표현은 제약적이며, 특정 조건에서 날씨 잔차가 과도하게 확대될 수 있다.

실무 활용

단일 이미지에서의 카메라/객체/날씨 제어가 필요한 콘텐츠 제작, 시뮬레이션 및 게임 개발에 활용 가능

  • 자동차 시뮬레이션에서 동일한 카메라 경로로 다양한 날씨를 합성
  • 영화/게임 촬영에서 특정 카메라 움직임을 유지하며 날씨만 바꿔 편집
  • 자율주행 데이터 수집에서 날씨 조건별 고정된 구성을 재생성
  • 날씨 데이터 증강을 위한 단일 프레임 기반의 날씨 전이

코드 공개 여부: 공개

코드 저장소 보기

키워드

video world modelscontrollable camera motionobject motionweather generationsource-to-stateHoloStateDataHolo-WorldUnified Scene Adapterscene preservationweather transferrendered backgroundgeometry buffersScene-Weather Decomposed CFG

용어 해설

HoloStateData
본 논문에서 제시하는 state 변환 학습을 위한 데이터셋으로, 실제 비디오와 페어링된 날씨 영상, 날씨 전이 비디오를 동일한 인터페이스로 구성하여 카메라 포즈, 기하 anchors, 객체 제어, 장면 텍스트, 날씨 상태를 함께 학습한다.
Unified Scene Adapter(Unified Scene Adapter (UniSA))
Wan 백본에 월드 보존 잔차와 날씨 전이 잔차를 독립적으로 주입하는 모듈로, World Adapter와 State Adapter로 구성되어 두 잔차를 분리 학습하고 같은 고정 백본을 공유한다.
Scene-Weather Decomposed CFG
샘플링 시 Scene 잔차와 Weather 잔차를 분리 적용하는 가이던스 분해 전략으로, Real/Simulation/V2V 샘플 간의 공통 콘텍스트에서 날씨 효과를 독립적으로 강화한다.
G-buffer 컨트롤(G-buffer controls)
렌더링 파이프라인에서 색상/깊이/법선 등 기하 정보를 담는 버퍼로, 소스 월드의 구조를 안정적으로 유지하는 데 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 18.수집 2026. 06. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.