본문으로 건너뛰기
HF Daily Papers조회 1

TrackCraft3R: Dense 3D Tracking을 위한 Video Diffusion Transformer의 재활용

단일 프레임 단위로 생성하는 frame-anchored 비디오 DiT의 한계를 극복하고, 참조 프레임에 고정된 트래킹 포인트를 따라가며 3D 모션을 추출한다. TrackCraft3R은 dual-latent representation과 temporal RoPE alignment를 통해 비디오 DiT의 시공간 priors를 밀집 3D 트래킹으로 직접 이용한다.

용어 해설

이중 잠재 표현(Dual-latent Representation)
이 논문에서 3D 프레임별 기하 정보와 참조 프레임에 고정된 트래킹 정보를 각각 인코딩하는 geometry latents와 first-frame anchored track latents의 이중 구조를 도입한다. 두 유형의 latent가 서로 보완적으로 작동해 프레임 간 일관된 트래킹을 가능하게 한다.
시간적 RoPE 정렬(Temporal RoPE Alignment)
RoPE를 시간 축에 적용하여 각 track latent가 attention을 수행할 때 목표 타임스탬프tj를 지정한다. 이렇게 하면 track latent가 지목한 geometry latent가 정확한 시점의 3D 포지션을 참조하도록 유도한다.
참조 기반 트래킹(Reference-Anchored Tracking)
트래킹 포인터가 고정된 reference 프레임(I0)에 묶여 sequence 전반에 걸쳐 같은 물리적 포인트를 추적하도록 하는 표현으로, 프레임별(content) 대신 참조 프레임의 포인트를 중심으로 관찰치를 정렬한다.
디퓨전 prior(Diffusion Prior)
비디오 diffusion transformer가 인터넷 규모의 동영상을 통해 학습한 spatio-temporal prior를 활용해 3D 포인트 매핑 및 트래킹에 활용한다.
프레임-기반에서 참조 기반으로의 고정(Frame-to-Reference Anchoring)
입력은 프레임-앵커 reconstruction pointmap이고 출력은 참조 프레임에 고정된 트래킹 pointmap이다. 이 둘 사이의 차이를 극복하기 위해 dual-latent 및 RoPE 정렬을 도입한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 12.수집 2026. 05. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.