본문으로 건너뛰기

LooseControlVideo: Spatial Blocking을 이용한 Directorial 영상 제어를 위한 LooseControlVideo (LCV) 프레임워크

현대의 비디오 디퓨전 모델은 시퀀스 내 다중 객체의 spatio-temporal 동작을 정확히 제어하기 어렵다. 2D 박스나 흐름 기반 제어는 동일한 장면에서 깊이/occlusion 관계를 일관되게 유지하기 어렵고, 3D 정보의 직접적인 활용은 학습 부담을 증대한다. LCV는 oriented 3D boxes를 3D 공간 차원의 제어 프록시로 사용하고, DNOCS 인코딩으로 깊이-오클루전 정보를 2D 컨디셔닝으로 변환하여 Wan 2.2 DiT 기반 비디오 생성 모델의 제어를 향상시킨다. 실험적으로 nuScenes, HO-3D, BEHAVE에서 2D 기반 baselines 대비 Trajectory Error를 1.2-3x, Occlusion Accuracy를 1.5-2x 개선했다.

용어 해설

지향된 3D 박스(Oriented 3D Boxes)
3D 공간에서 물체의 위치, 방향, 크기를 표현하는 직육면체 프리미티브로, Dee p order(깊이 순서)와 가려짐을 표현하는 데 사용된다. 이 박스는 레이 트레이싱과 DNOCS 인코딩과 결합되어 시각화와 제어 신호를 2D 비디오 모델에 전달하는 기초 단위가 된다.
DNOCS
Depth-modulated Normalized Object Coordinate Space의 약자로, 물체의 표면 방향과 깊이 정보를 결합한 3D-근거의 색상 인코딩이다. 3D 프리미티브의 방향과 깊이 순서를 2D 컨디셔닝에 직접 전달하는 방식이다.
확산 트랜스포머(Diffusion Transformer)
Diffusion Transformer(DiT) 기반 비디오 생성 모델을 3D 제어 신호에 맞춰 안정적으로 조건화하기 위한 핵심 구성요소. 시간적 컨텍스트를 길게 활용할 수 있다.
VACE 컨디셔닝(VACE conditioning)
Video Abstraction-Conditioned Embedding의 약자로, 컨트리닝 Residuals를 DiT 백본에 주입하는 일련의 모듈을 가리킨다. LoRA 미세조정을 통해 제어 신호의 효과를 강화한다.
3D 차폐/블로킹(3D Blocking)
촬영 연출에서 공간 배치를 3D 프리미티브로 단순화해 제어를 가능하게 하는 기법으로, 다중 객체의 위치/방향/크기를 제어하는 상위 레벨 표현이다.
DNOCS 렌더링(DNOCS Rendering)
DNOCS 인코딩을 컨디셔닝 이미지로 렌더링해 3D 정보와 깊이 정보를 2D 입력으로 변환하는 과정이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 17.수집 2026. 06. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.