용어 해설
- 쿼리 토큰(Query Tokens)
- — 컨텍스트 토큰과 예측 토큰 사이에서 주의를 수행하여 과거 프레임으로부터 유용한 정보를 선택적으로 추출하는 학습 가능한 토큰 집합으로, diffusion 과정의 각 단계와 예측 프레임마다 서로 다른 주의 분포를 학습하여 장기 기억을 지원한다.
- Diffusion Transformer(Diffusion Transformer (DiT))
- — latent 영상 확산 모델에서 시공간적 주의를 포함하는 Transformer 기반 생성기 구조로, 2D attention, 3D attention, cross-attention, FFN 블록을 순차적으로 적용해 노이즈 예측을 수행하여 고품질 비디오를 생성하는 핵심 아키텍처이다.
- 컨텍스트 검색(Context Retrieval)
- — 과거 프레임들 가운데 현재 생성에 유효한 프레임을 선택하여 조건으로 제공하는 기법으로, 규칙 기반 FOV 중첩이나 포인트클라우드 매칭이 기존 방식이며 본문에서는 이를 학습 가능한 쿼리로 대체하여 일반화 성능을 개선한다.
- 카메라 인코더(Camera Encoder)
- — 프레임별 카메라 포즈(R, t)를 소형 MLP로 임베딩하여 Diffusion Transformer 내부 특징에 주입하는 모듈로, 서로 다른 데이터셋의 포즈 품질을 분리 처리하기 위해 데이터 타입별 전용 인코더를 사용한다.
- 재방문 비교(Revisit Comparison)
- — 카메라가 장면을 되돌아올 때 생성된 전·후 경로의 대응 프레임 쌍을 비교하여 장면 일관성과 기억 능력을 계량화하는 평가 방식으로, outbound와 return 경로의 PSNR과 LPIPS 평균으로 메모리 성능을 측정한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



