TL;DR
현대의 비디오 디퓨전 모델은 시퀀스 내 다중 객체의 spatio-temporal 동작을 정확히 제어하기 어렵다. 2D 박스나 흐름 기반 제어는 동일한 장면에서 깊이/occlusion 관계를 일관되게 유지하기 어렵고, 3D 정보의 직접적인 활용은 학습 부담을 증대한다. LCV는 oriented 3D boxes를 3D 공간 차원의 제어 프록시로 사용하고, DNOCS 인코딩으로 깊이-오클루전 정보를 2D 컨디셔닝으로 변환하여 Wan 2.2 DiT 기반 비디오 생성 모델의 제어를 향상시킨다. 실험적으로 nuScenes, HO-3D, BEHAVE에서 2D 기반 baselines 대비 Trajectory Error를 1.2-3x, Occlusion Accuracy를 1.5-2x 개선했다.
왜 중요한가
현대의 비디오 디퓨전 모델은 시퀀스 내 다중 객체의 spatio-temporal 동작을 정확히 제어하기 어렵다. 2D 박스나 흐름 기반 제어는 동일한 장면에서 깊이/occlusion 관계를 일관되게 유지하기 어렵고, 3D 정보의 직접적인 활용은 학습 부담을 증대한다. LCV는 oriented 3D boxes를 3D 공간 차원의 제어 프록시로 사용하고, DNOCS 인코딩으로 깊이-오클루전 정보를 2D 컨디셔닝으로 변환하여 Wan 2.2 DiT 기반 비디오 생성 모델의 제어를 향상시킨다. 실험적으로 nuScenes, HO-3D, BEHAVE에서 2D 기반 baselines 대비 Trajectory Error를 1.2-3x, Occlusion Accuracy를 1.5-2x 개선했다.
핵심 기여
3D-aware spatial blocking을 위한 oriented 3D boxes 도입
다수 객체가 얽힌 영상에서도 레이아웃, 트래젝터리, 상호작용을 3D 프리미티브로 선언적으로 정의할 수 있게 하여, 디퓨전 비디오 모델이 국부 변형 대신 전역 기하 포지션을 먼저 학습하도록 한다.
DNOCS 인코딩을 통한 3D-도메인 컨디셔닝
Depth와 NOCS의 결합으로 3D 방향-깊이 정보를 2D 컨디셔닝으로 반영하는 DNOCS를 제시하고, 이는 모델이 깊이 순서와 시점 간 가려짐을 더 정확히 처리하도록 한다.
자동 학습 데이터 파이프라인 구축
GroundingDINO, SAM, monocular depth 추정기를 사용해 약 10k 비디오에 대해 3D oriented box 트랙을 자동으로 생성하고 Kalman 필터로 temporally 일관된 박스 시퀀스를 얻는다.
VACE 모듈의 LoRA 미세조정으로 제어 가능성 강조
Wan 2.2 backbone의 DiT 기반 비디오 생성 모델에서 VACE 모듈을 LoRA(가로 rank 64)로 미세 조정해, 기본 모델을 변형하지 않고도 제어 신호를 효과적으로 반영한다.
새로운 구조-기반 평가 지표 제안
Spatio-temporal 제어에 대한 구성 충족도, 트래젝터리 정확도, 오클루전 순서를 평가하는 Novel metrics를 제안하고 nuScenes/HO-3D/BEHAVE에서 우수한 성능을 보인다.
핵심 아이디어 이해하기
단계적 출발점: 생성 모델은 2D 영상 공간에서 표면적 품질은 뛰어나나, 3D 공간에서의 객체 간 관계(깊이, 시점별 가려짐, 시점 간 일관성) 제어는 약하다. 이로 인해 다중 객체의 정밀한 3D 운용은 비효율적으로 이루어지며, 제어 입력이 텍스트나 2D 신호에 머무를 때 한계가 크다. oriented 3D boxes는 전역적인 레이아웃과 로컬한 움직임(변형)을 구분하는 추상 프록시를 제공한다. DNOCS는 각 프록시의 방향 정보를 색상으로, 깊이는 밝기로 표현해 2D 입력에 3D 정보를 직접 제공한다. 이로써 DiT 기반 비디오 생성기가 깊이 순서와 시차에 따른 시각적 부합성을 학습하기가 쉬워진다. 3D 프록시를 2D 컨디셔닝으로 렌더링하는 접근은 모델이 3D-투영을 내부적으로 재구성해야 하는 부담을 크게 줄이고, 데이터 수집 측면에서도 자동 라벨링 파이프라인으로 10k 영상 분량의 학습 소스를 확보한다. 결과적으로 oriented 3D 프록시는 복합적인 다중 객체 상호작용에서 더 나은 구조적 정합성과 시간적 일관성을 제공한다. 기존 접근과의 차이는 2D-박스/Flow 기반 제어가 가지는 깊이/시점 일관성 문제를 DNOCS로 보완하고, 3D 프록시가 전역 동작(trajectory)과 국부 변형(deformation)을 분리하므로 편향 없이 제어를 확장한다. 한계 영역으로는 3D 박스에 특정 시각적 ID를 명시적으로 매핑하지 않으므로 다중 객체(identity) 간 구분이 어려울 수 있다. 또한 타이밍은 사용자가 수동으로 설정해야 하는 부분이 남아 있다. 이로써 제작자-모델 간 협업(Director-in-the-loop) 방식으로 시나리오를 빠르게 실험 가능하게 한다.
관련 Figure

제어 신호를 oriented 3D boxes로 표현하는 개념과 2D-공간에서의 컨디셔닝 매핑 흐름을 시각적으로 보여준다. core_intuition를 보강하는 도해로 활용 가능
LCV의 3D blocking 아이디어를 시각적으로 요약하는 도해 이미지
방법론
단락 1: 전체 접근 방식과 핵심 아이디어 - p, b, c로 구성된 입력 조건을 DiT 기반 비디오 모델에 제공한다. 제어 신호 b는 시간에 따른 oriented 3D boxes의 시퀀스이며, 카메라 파라미터 c도 포함한다. 좌표를 직접 토큰으로 주입하는 대신, 3D 박스를 카메라 관점에서 렌더링해 2D 공간의 conditioning 맵으로 바꾼다. 이 맵은 깊이 순서, 시점 간 가려짐, 원근 정보를 모두 포함하는 v_ctrl로 비디오 생성 모델에 전달된다. 이 과정을 통해 3D-도메인 정보와 2D 영상 공간 사이의 표현 격차를 줄인다.
관련 Figure

DNOCS 인코딩의 흐름과 3D 프록시의 렌더링-2D 컨디셔닝 연결고리를 시각화한다. methodology를 보강하는 도해
Depth-modulated DNOCS 인코딩의 시각적 예시 및 DNOCS 레이어 구성
주요 결과
단락 1: 메인 벤치마크 결과 - nuScenes에서 2D 플로우/2D 박스 기반 Baselines 대비 Trajectory Error(TrajErr)가 5.79로 감소, Occlusion Acc가 92.69로 증가했다(2D Boxes 대비 TrajErr 16.66; OcclAcc 42.45). GMFA는 0.066으로 감소했고 RMC는 0.318로 개선되었다. Contain은 87.93, GOW는 97.32로 나타났다. HO-3D/BEHAVE에서도 LCV가 GMFA, RMC, TrajErr에서 우수한 정합성을 보였고, OcclAcc도 높은 편이다.
관련 Figure

LCV가 2D 박스/Flow 기반 대안 대비 TrajErr, OcclAcc 등 주요 지표에서 우수함을 시각적으로 확인 가능. results를 직접 보강
nuScenes/HO-3D/BEHAVE에서의 LCV 결과 스크린샷 모음

편집 모드에서 DNOCS가 원본 영상의 아이덴티티를 유지하면서 새로운 트래젝터리를 반영하는 모습을 보여준다. methodology+results에 해당
편집 시나리오에서의 DNOCS 기반 제어를 이용한 모션 편집 예시

다양한 제어 신호 간의 차이를 비교해 oriented 3D박스의 우수성을 정량적으로 뒷받침한다. results와 methodology를 함께 보강
DNOCs 기반 oriented box와 대체 제어(2D/Depth/Mesh/Optical Flow) 간 비교
기술 상세
- 아키텍처: DiT 기반 비디오 생성 모델에 DNOCS 조건화 경로를 추가하기 위해 VACE 모듈을 LoRA로 미세조정한다( rank 64, 10k 이터레이션, 4 x H100 80GB). 2) DNOCS 렌더링: 3D 박스의 중심 C_w, 회전 R_wb, 반대안 h를 이용해 월드 좌표에서 카메라 좌표계로 변환하고, 박스와 화면의 교차를 이용해 z(u,v) 깊이를 계산한다. 깊이 값을 d(u,v)로 정규화하고 b(d) = β_min + (1-β_min) exp(-k(1-d))를 적용해 밝기를 조정한 뒤 rgb_DNOCS(u,v) = rgb_orient(u,v) ⊙ b(d(u,v))로 색상을 얻는다. 배경은 m=0, z=+∞로 설정한다. 3) 학습 데이터 파이프라인: GroundingDINO, SAM으로 물체 마스크를 얻고, monocular depth로 포인트 클라우드를 추정해 프레임별 oriented 3D 박스를 구성하며 Kalman filter로 트랙을 매끄럽게 정제한다. 4) 학습/추론: 제어 신호 v_ctrl를 VACE 컨디셔닝 경로에 주입해 DiT를 통해 비디오를 생성하거나 입력 비디오와 DNOCS를 혼합해 편집한다.
한계점
Identity-to-Box 매핑 부재: 3D 박스에 특정 시각적 아이덴티티를 명시적으로 연결하지 않는다. 개선 방향으로 다중 뷰 참조 이미지를 도입해 3D 앵커에 대한 아이덴티티 보존을 시도한다. Manual Timing: 제작자가 상호작용 타이밍을 수동으로 지정해야 하므로, 시간 배치 자동 추론 연구가 필요하다.
실무 활용
간단한 3D 프록시를 이용한 직관적인 영상 연출 제어를 통해 향상된 시나리오 제작과 편집이 가능하다.
- 영화/드라마 제작의 시퀀스 연출 자동화
- 비디오 게임 컷신 제작의 프레이밍/트래젝터리 제어
- AR/VR 콘텐츠의 실시간 3D 프록시 기반 편집
- 드라마틱한 악세서리/소품의 동적 상호작용 시뮬레이션
코드 공개 여부: 미확인
키워드
용어 해설
- Oriented 3D Boxes
- — 3D 공간에서 물체의 위치, 방향, 크기를 표현하는 직육면체 프리미티브로, Dee p order(깊이 순서)와 가려짐을 표현하는 데 사용된다. 이 박스는 레이 트레이싱과 DNOCS 인코딩과 결합되어 시각화와 제어 신호를 2D 비디오 모델에 전달하는 기초 단위가 된다.
- DNOCS
- — Depth-modulated Normalized Object Coordinate Space의 약자로, 물체의 표면 방향과 깊이 정보를 결합한 3D-근거의 색상 인코딩이다. 3D 프리미티브의 방향과 깊이 순서를 2D 컨디셔닝에 직접 전달하는 방식이다.
- Diffusion Transformer
- — Diffusion Transformer(DiT) 기반 비디오 생성 모델을 3D 제어 신호에 맞춰 안정적으로 조건화하기 위한 핵심 구성요소. 시간적 컨텍스트를 길게 활용할 수 있다.
- VACE conditioning
- — Video Abstraction-Conditioned Embedding의 약자로, 컨트리닝 Residuals를 DiT 백본에 주입하는 일련의 모듈을 가리킨다. LoRA 미세조정을 통해 제어 신호의 효과를 강화한다.
- 3D Blocking
- — 촬영 연출에서 공간 배치를 3D 프리미티브로 단순화해 제어를 가능하게 하는 기법으로, 다중 객체의 위치/방향/크기를 제어하는 상위 레벨 표현이다.
- DNOCS Rendering
- — DNOCS 인코딩을 컨디셔닝 이미지로 렌더링해 3D 정보와 깊이 정보를 2D 입력으로 변환하는 과정이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.