왜 중요한가
영상 세계 모델에서 카메라/객체 제어와 환경 상태를 하나의 인터페이스로 다루는 일은 데이터와 모델 정렬의 난제로 남아 있다. 본 논문은 HoloStateData로 unified 제어 신호를 수집하고, UniSA와 Scene-Weather Decomposed CFG를 통해 세계 보존과 날씨 전이 잔차를 분리 학습·샘플링함으로써 소스 세계의 구조를 유지하면서 다양한 날씨 상태로의 전이가 가능해진다. 이로써 비디오-투-비디오 편집 기반의 날씨 편집 대비 단일 프레임에서의 1-shot 학습으로도 높은 품질의 날씨 변환과 카메라/객체 제어 일관성을 달성한다.
핵심 기여
Unified state control for video world models
단일 이미지에서 카메라/객체 제어와 날씨 전이를 하나의 인터페이스로 수행하는 통합적인 영상 세계 모델의 설계
HoloStateData
현실 비디오, 페어링된 시뮬레이션 날씨 비디오, 날씨 전이 비디오를 카메라 포즈/geometry anchors/객체 제어/장면 텍스트/날씨 상태 supervision으로 정렬하는 state-간 샘플링 데이터셋
Unified Scene Adapter (UniSA)
World Adapter와 State Adapter로 잔차를 분리 학습시키고, 동일한 Wan 백본에서 월드 보존과 날씨 전이를 각각 다른 잔차 공간으로 주입하는 모듈
Scene-Weather Decomposed CFG
샘플링 시 장면 잔차와 날씨 잔차를 독립적으로 가이드하는 CFG 분해로, 날씨 효과를 강화하되 전체 조건의 과잉 증폭을 방지
실험적으로 V2V 편집 baselines를 능가
Weather 전이에서 Weather Alignment 및 VLM Evaluation에서 우수한 성능을 보이고 Real subset의 카메라/객체 제어 정확도도 향상
데이터/실험 규모 명시
HoloStateData는 15K 학습 샘플, 벤치마크는 Real/Simulation/V2V 각 50샘플로 구성되며 Wan2.1-T2V-14B 백본 위에서 학습
핵심 아이디어 이해하기
단락 1: 영상 세계 모델은 관찰 가능한 월드의 변화를 예측하는 것인데, 혼합된 제어 신호(카메라 포즈/배경 구조/객체 동작)와 환경 상태(날씨)를 함께 다루면 잔차가 서로 간섭하고 품질이 저하된다. 기존 방법은 카메라/객체 제어와 날씨 편집을 분리하거나 비디오-투-비디오 편집에 의존해 단일 이미지에서의 제어가 약했다. 이 문제를 기초 개념으로 정의한다.
방법론
단일 프레임에서 Observed World를 보존하기 위한 Cworld와 Weather 상태를 위한 Cstate를 분리된 텍스트 조건으로 입력받고, 이를 Wan 백본에 주입한다. UniSA는 World Adapter와 State Adapter의 두 잔차 공간을 통해 동일 백본에서 서로 다른 잔차를 학습하며, λw와 λs가 잔차의 스케일을 조절한다. Scene-Weather Decomposed CFG는 sampling 시 v∅, vscene, vfull의 세 예측을 통해 scene 잔차와 weather 잔차를 분리하여 가이던스를 조합한다.
주요 결과
Real subset에서 BBench-I2V 및 카메라/객체 제어 지표가 높고 RotErr가 0.719로 최저를 기록했다. Weather subset에서 Weather Alignment 86.00%, VLM Evaluation 68.51을 달성했고, Human User Study에서 Cosmos-Transfer2.5 대비 83.00%를, Wan2.7-Edit 대비 62.00%를 얻었다. SW-CFG를 추가하면 Weather Alignment과 VLM Evaluation이 크게 향상되며, background preservation 지표도 유지된다. ablation 결과는 G-buffer, UniSA, SW-CFG의 조합이 최적의 성능을 낸다.
기술 상세
전체 아키텍처는 UniSA가 Wan2.1-T2V-14B 백본에 잔차를 주입하도록 구성된다. L = {0, 5, 10, 15, 20, 25}의 DiT 층에서 World Adapter와 State Adapter를 통해 각각 잔차를 추가하고, 월드 잔차 λw는 1로 고정하며 상태 잔차 λs는 weather prompt의 여부에 따라 0/1로 설정한다. 학습은 VAE, 텍스트 인코더, Wan 백본은 고정되고 World/State Adapter만 학습한다. 손실은 Wan Flow를 목표로 하는 Lflow를 사용하며, Cworld = {Rrgb, Rdepth, Rnormal, Cbbox}, Cstate = {Rrgb}로 정의된다. SW-CFG는 v∅, vscene, vfull의 세 예측을 기반으로 scene residual ∆scene = vscene − v∅과 weather residual ∆weather = vfull − vscene를 정의하고, v̂ = v∅ + sscene∆scene + sweather∆weather의 형태로 가이던스를 분리한다. 학습 데이터는 Real, Simulation, V2V의 세 서브셋으로 구성되며, Real은 비편집 월드 보존을, Simulation/V2V는 날씨 전이를 학습에 반영한다. 81프레임 RGB/깊이/노멀 기반의 소스 컨트롤 렌더링은 소스 월드의 구조를 고정하고 날씨 프롬프트만 타겟으로 학습한다.
한계점
본 방법의 초점은 단일 이미지로부터의 controllable video generation이며, 실제 물리 시뮬레이션 전체를 대체하는 범위는 아니다. 날씨 잔차의 표현은 제약적이며, 특정 조건에서 날씨 잔차가 과도하게 확대될 수 있다.
실무 활용
단일 이미지에서의 카메라/객체/날씨 제어가 필요한 콘텐츠 제작, 시뮬레이션 및 게임 개발에 활용 가능
- 자동차 시뮬레이션에서 동일한 카메라 경로로 다양한 날씨를 합성
- 영화/게임 촬영에서 특정 카메라 움직임을 유지하며 날씨만 바꿔 편집
- 자율주행 데이터 수집에서 날씨 조건별 고정된 구성을 재생성
- 날씨 데이터 증강을 위한 단일 프레임 기반의 날씨 전이
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- HoloStateData
- — 본 논문에서 제시하는 state 변환 학습을 위한 데이터셋으로, 실제 비디오와 페어링된 날씨 영상, 날씨 전이 비디오를 동일한 인터페이스로 구성하여 카메라 포즈, 기하 anchors, 객체 제어, 장면 텍스트, 날씨 상태를 함께 학습한다.
- Unified Scene Adapter(Unified Scene Adapter (UniSA))
- — Wan 백본에 월드 보존 잔차와 날씨 전이 잔차를 독립적으로 주입하는 모듈로, World Adapter와 State Adapter로 구성되어 두 잔차를 분리 학습하고 같은 고정 백본을 공유한다.
- Scene-Weather Decomposed CFG
- — 샘플링 시 Scene 잔차와 Weather 잔차를 분리 적용하는 가이던스 분해 전략으로, Real/Simulation/V2V 샘플 간의 공통 콘텍스트에서 날씨 효과를 독립적으로 강화한다.
- G-buffer 컨트롤(G-buffer controls)
- — 렌더링 파이프라인에서 색상/깊이/법선 등 기하 정보를 담는 버퍼로, 소스 월드의 구조를 안정적으로 유지하는 데 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.