용어 해설
- 이중 잠재 표현(Dual-latent Representation)
- — 이 논문에서 3D 프레임별 기하 정보와 참조 프레임에 고정된 트래킹 정보를 각각 인코딩하는 geometry latents와 first-frame anchored track latents의 이중 구조를 도입한다. 두 유형의 latent가 서로 보완적으로 작동해 프레임 간 일관된 트래킹을 가능하게 한다.
- 시간적 RoPE 정렬(Temporal RoPE Alignment)
- — RoPE를 시간 축에 적용하여 각 track latent가 attention을 수행할 때 목표 타임스탬프tj를 지정한다. 이렇게 하면 track latent가 지목한 geometry latent가 정확한 시점의 3D 포지션을 참조하도록 유도한다.
- 참조 기반 트래킹(Reference-Anchored Tracking)
- — 트래킹 포인터가 고정된 reference 프레임(I0)에 묶여 sequence 전반에 걸쳐 같은 물리적 포인트를 추적하도록 하는 표현으로, 프레임별(content) 대신 참조 프레임의 포인트를 중심으로 관찰치를 정렬한다.
- 디퓨전 prior(Diffusion Prior)
- — 비디오 diffusion transformer가 인터넷 규모의 동영상을 통해 학습한 spatio-temporal prior를 활용해 3D 포인트 매핑 및 트래킹에 활용한다.
- 프레임-기반에서 참조 기반으로의 고정(Frame-to-Reference Anchoring)
- — 입력은 프레임-앵커 reconstruction pointmap이고 출력은 참조 프레임에 고정된 트래킹 pointmap이다. 이 둘 사이의 차이를 극복하기 위해 dual-latent 및 RoPE 정렬을 도입한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




