TL;DR
단일 카메라 참조 동영상에서 사용자가 지정한 카메라 궤적로 새로운 시점의 동영상을 합성하려면 시점 제어, 기하학적 일관성, 모션 보존이 동시에 필요하다. MVTrack4Gen은 DiT의 특정 attention 레이어에서 추출한 대응 단서를 다중뷰 포인트 트래킹 감독으로 활용해 명시적 3D 재구성 없이 기하·모션 일관성을 크게 개선한다.
왜 중요한가
단일 카메라 참조 동영상에서 사용자가 지정한 카메라 궤적로 새로운 시점의 동영상을 합성하려면 시점 제어, 기하학적 일관성, 모션 보존이 동시에 필요하다. MVTrack4Gen은 DiT의 특정 attention 레이어에서 추출한 대응 단서를 다중뷰 포인트 트래킹 감독으로 활용해 명시적 3D 재구성 없이 기하·모션 일관성을 크게 개선한다.
핵심 기여
어텐션 레이어에서의 대응 신호 발견과 재활용
비디오 Diffusion Transformer(DiT)의 특정 중간 레이어(주요 피크는 18번째 레이어)에서 intra-video temporal 및 inter-video cross-view 대응이 강하게 나타남을 규명했고, 이 레이어의 쿼리/키 특징을 추출해 추가적 기하·모션 감독으로 재사용했다.
다중-뷰 포인트 트래킹 헤드와 4D 상관 볼륨 설계
DiT의 선택된 attention 특징으로부터 지역적 multi-scale 4D correlation volume을 구성하고, 이를 입력으로 하는 transformer 기반의 multi-view tracking head(예: 예측 잔차 ΔP, ΔV, ΔC)를 도입해 동일 물리점의 시공간/시점 추적을 학습했다.
어텐션 레벨 직접 감독을 위한 multi-view correspondence loss
Attention 행렬(C^{v1,v2}_{i,j})에 대해 cross-entropy 단일-레이블 분류 손실을 적용해 각 target 쿼리 토큰이 가시화된 정답 위치에 가장 높은 확률을 할당하도록 학습했다. 이 손실은 λ_corr = 0.01로 총 손실과 결합되었다.
Diffusion 모델과 트래킹 헤드의 공동 학습으로 기하·모션 통합
교차-엔트로피 기반 correspondence loss, 다중뷰 트래킹 손실(ℒ_seq, ℒ_conf, ℒ_vis)과 Rectified-flow 형태의 diffusion loss를 함께 최적화해 explicit 3D 없이도 DAVIS 및 iPhone 벤치마크에서 MEt3R 등 기하학적 일관성 지표에서 최고 성능을 달성했다.
카메라 인코딩 확장(Plücker ray maps)과 백본 공통성
ReCamMaster 및 Redirector 두 camera-conditioning-only 백본에 동일한 방법을 적용해, Plücker ray map(엑스트린식/인트린식 포함)을 각 DiT 레이어에 주입하고 3D attention 레이어와 카메라 인코더만 파인튜닝했다.
핵심 아이디어 이해하기
문제 출발점과 기존 한계: 단일 레퍼런스 비디오에서 사용자가 지정한 카메라 궤도로 novel-view 비디오를 합성하려면 장면의 3D 구조와 동적 물체의 시간적 궤적을 모두 보존해야 한다. 기존의 Explicit 3D Lifting 계열은 외부 재구성 모듈에 의존해 동적 객체의 잘못된 깊이 추정이나 불완전한 기하가 있다면 타겟 합성에 왜곡과 flying-pixel을 유발했다. 반면 camera-conditioning-only 계열은 고품질의 외관을 얻으나 명시적 기하학적 그라운딩이 없어 동적 객체의 위치·모션 일관성이 떨어지는 한계가 있다.
관련 Figure

이 다이어그램은 reference와 target의 latent 프레임들이 하나의 3D attention 맵에서 어떻게 교차하는지 구조적으로 정리한다. 논문의 핵심 관찰인 '특정 중간 레이어에서 intra-video temporal과 inter-video cross-view correspondence가 동시에 두드러짐'을 직관적으로 연결해, 어떤 attention 범위를 추출해 트래킹 헤드에 공급해야 하는지를 뒷받침한다.
3D attention의 블록 구조를 행렬 형태로 나타내며 intra-video(시간)와 inter-video(시점) 대응 블록을 구획해 보여준다.

이 시각화는 attention 기반 대응의 품질이 직접적으로 모션 일관성에 영향을 준다는 주장을 보강한다. ReCamMaster의 경우 쿼리점이 reference의 잘못된 영역을 주목하는 반면 MVTrack4Gen은 대응 영역으로 attention을 집중해 타겟에서의 동적 물체 위치와 참조 간 불일치가 줄어들었다는 근거를 제공한다.
ReCamMaster와 MVTrack4Gen의 생성 프레임과 reference 위에 중첩한 attention map을 비교한 예시로, MVTrack4Gen이 쿼리점에 대해 더 정확한 참조 위치를 집중(attend)함을 보여준다.

이 플롯은 특정 중간 레이어(약 18층)에서 intra-video 및 inter-video 대응 지표가 피크를 보임을 정량적으로 보여준다. 따라서 해당 레이어의 쿼리/키 특징을 추출해 tracking supervision에 쓰는 설계 결정의 근거가 된다.
레이어 및 denoising timestep에 따른 matching accuracy와 harmonic mean(accuracy, attention score, confidence)을 3D 그래프로 보여준다.
방법론
전체 접근과 핵심 아이디어: 입력으로 reference video X_ref와 목표 카메라 cam_tgt을 받아 VAE로 각 뷰를 latent z_ref, z_tgt로 인코딩한 뒤 DiT에 [z_ref, z_tgt]를 토큰 차원으로 연결해 3D Attention을 수행한다. DiT 내부 특정 중간 레이어의 쿼리 Q와 키 K에서 emergent correspondence가 두드러져, 해당 레이어의 Q/K를 추출해 multi-scale 4D correlation volume을 구성하고 transformer 기반 multi-view tracking head에 공급한다.
관련 Figure

이 그림은 DiT로부터 생성된 타겟 프레임과 동시에 multi-view point tracks를 생성해 3D 공간에서 레퍼런스와 생성 결과가 정렬되는지를 시각화한다. Depth Anything 3로 리프팅한 포인트 클라우드 상에서 동적 객체의 궤적과 위치가 일치하는지 확인해 MVTrack4Gen이 명시적 3D 재구성 없이도 기하·모션 일관성을 보존함을 보강한다.
MVTrack4Gen의 입력(단일 레퍼런스 비디오 + 카메라 경로)에서 생성된 타겟 비디오와 다중뷰 포인트 트랙을 3D로 리프팅한 결과를 보여준다.
주요 결과
메인 벤치마크 성능(DAVIS/iPhone): DAVIS에서 MVTrack4Gen을 ReCamMaster에 결합한 경우 MEt3R이 3.660 → 1.858로 개선(Δ = -1.802)되었고, MEt3R_dynamic은 0.113 → 0.100으로 감소했다. Redirector 기반에서도 MEt3R은 0. (테이블 참조) iPhone에서는 ReCamMaster의 PSNR이 11.005 → 11.521(+0.516)로 개선되었고, LPIPS 및 MEt3R에서도 개선이 나타났다. Ablation 결과: (i) Plücker 인코딩, (ii) correspondence loss 단독 적용, (iii) tracking module 단독 적용, (iv) 두 구성 통합 순으로 비교했을 때 (iv)가 PSNR 11.389, MEt3R 0.416 등 최종 성능을 보였다.
관련 Figure

포인트 클라우드 렌더링 비교는 MVTrack4Gen이 동적 전경의 위치·형상 일관성을 유지하며 참조와 생성 뷰 간 정렬을 개선했음을 시각적으로 검증한다. 이는 양자 지표(MEt3R, MEt3R_dynamic)에서의 개선과 일치한다.
DAVIS 및 다른 데이터셋의 예시에서 ReCamMaster/Redirector와 MVTrack4Gen의 생성 결과 및 Depth Anything3로 리프팅한 포인트 클라우드 비교를 보여준다.

이 패널은 실세계 핸드헬드 캡처 환경에서 MVTrack4Gen이 카메라-조건화 전용 백본에 추가적인 대응 감독을 도입함으로써 target 시점의 색감·구조를 보다 잘 보존하는 경향을 보임을 시각적으로 보완한다. 특히 explicit 3D lifting 계열이 깊이 오류로 인한 왜곡을 보이는 영역에서 MVTrack4Gen은 비교적 자연스러운 합성을 유지한다.
iPhone 데이터셋에서 여러 비교 방법(GEN3C, TrajectoryCrafter, CogNVS, ReCamMaster, Redirector 등)과 MVTrack4Gen의 타겟 뷰 합성 결과를 나란히 보여준다.
기술 상세
아키텍처 구성: 입력 비디오는 VAE로 압축되어 z_ref, z_tgt ∈ ℝ^{f×h×w×d_video}가 생성된다. DiT는 두 latent의 연결된 토큰을 받아 flow-matching 기반의 velocity 예측자 v_θ([z_ref, z_tgt], t, c, cam_tgt)를 학습한다. DiT 내부의 3D Attention 블록은 각 뷰·프레임의 쿼리 Q^{v}_i, 키 K^{v}_j ∈ ℝ^{hw×d_head}를 생성하고, 어텐션 행렬은 Softmax( Q^{v1}_i (K^{v2}_j)^T / sqrt(d_head) )로 계산된다. [입력: Q,K] → [연산: 내적/스케일 후 softmax] → [결과: attention weight matrix C] → [의미: 어느 토큰이 어떤 위치를 참조하는지 확률분포로 표현].
관련 Figure

이 도해는 VAE 인코더/디코더, DiT 블록(3D self-attention, text cross-attention, feed-forward), Plücker camera encoder, 및 multi-view tracking module의 입력(4D correlation volumes, visibilities 등)과 출력(ΔP, ΔV, ΔC)을 연결해 구현적 세부를 분명히 한다. 논문에서 기술한 손실 조합과 학습 파이프라인을 재현할 때 참고값을 제공한다.
전반적인 DiT 아키텍처와 DiT 블록, 그리고 Cross-View Tracking Module의 구성 요소를 한 장으로 정리한 아키텍처 도해이다.
실무 활용
코드 및 모델 구현은 공개되어 있어(https://github.com/cvlab-kaist/MVTrack4Gen) 실무에서 기존 camera-conditioning-only 백본에 대응 감독(signal)만 추가해 기하학적 일관성과 동적 객체 모션 보존을 개선할 수 있다.
- 가상 촬영(virtual cinematography)에서 단일 카메라 촬영을 바탕으로 원하는 카메라 궤도에 맞춘 안정적인 novel-view 영상 생성
- AR/VR에서 사용자가 지정한 시점으로의 실시간 또는 오프라인 장면 재현(동적 객체의 모션 보존 필요할 때)
- 로봇 시각에서 단일 시점 데이터로부터 다른 시점 합성·시뮬레이션을 통한 궤적 검증
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 3D Attention
- — DiT( Diffusion Transformer ) 내부에서 reference와 target의 latent 토큰이 합쳐져 수행되는 어텐션으로, 시공간 및 시점 간 정보가 레이어 단위로 교환된다. 쿼리-키 유사도로 구성되어 특정 레이어에서 시점 간 대응(correspondence)이 뚜렷하게 드러나며, 이 대응 정보가 기하학적 일관성 및 모션 보존에 직접적으로 영향을 준다.
- Plücker Ray Map
- — 카메라의 extrinsics와 intrinsics로부터 계산한 픽셀 단위 6차원 레이 표현이다. DiT의 각 레이어에 주입하여 카메라 포즈 정보를 밀도 있게 전달하고, 카메라 조건화만 사용하는 모델의 기하학적 정밀도를 높인다.
- Multi-View Point Tracking
- — 동일 물리적 점을 시간과 시점에 걸쳐 추적하는 기법으로, 여러 뷰의 쿼리·키 특징을 사용해 점의 2D 위치와 가시성(visibility)을 예측한다. 본 논문에서는 DiT의 특정 어텐션 레이어에서 나온 특징으로 tracking head를 학습시켜 기하학·모션 감독 신호로 사용한다.
- 4D Correlation Volume
- — 쿼리·키 특징의 지역적 유사도(로컬 윈도우)를 정리한 텐서로, 시간·공간·뷰 축을 포함한다. q와 k를 Δ-이내의 이웃에서 샘플링해 softmax로 정규화하고 tracking head의 입력으로 사용하여 시공간 매칭을 추정한다.
- MEt3R
- — 다중뷰 기하학적 일관성을 평가하는 지표로서 feed-forward 3D 재구성 결과를 기준으로 정합도를 측정한다. 낮을수록(작을수록) geometric inconsistency가 적다는 의미가 된다. 본 논문에서 주요 비교 지표로 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
