용어 해설
- Diffusion Transformer(DiT)
- — DiT는 Transformer 구조를 이미지 토큰과 텍스트 토큰 쌍으로 처리하여 교차-어텐션으로 조건부 확률 분포를 학습하는 확산 기반 이미지 생성 백본이다. 이미지와 텍스트를 별도 스트림으로 패치화한 뒤 Q/K/V를 생성하여 self-attention으로 융합하고 RoPE로 위치 정보를 유지한다. 본 논문은 이 DiT 백본을 동결한 채 기하학 토큰과 병렬 어텐션을 추가해 공간 정보를 주입한다.
- Rotary Positional Encoding(RoPE)
- — RoPE는 토큰 좌표를 회전 행렬 형태로 임베딩하여 Transformer의 어텐션 내에서 상대적 위치 정보를 보존하는 기법이다. 본문에서는 카메라 intrinsics/extrinsics와 z축 스케일을 RoPE의 하위 공간에 할당해 프러스텀 인지 및 스케일 앵커를 구현했다. RoPE의 하위분할을 통해 i, j, z 좌표를 각각 독립 서브스페이스로 인코딩하는 방식이 사용되었다.
- 암묵적 기하학 프라이어(Implicit Geometry Prior)
- — 암묵적 기하학 프라이어는 명시적 재구성 없이 피드포워드 기하학 네트워크의 중간 특징을 토큰화하여 생성 백본에 결합한 상대적 기하학 정보이다. 이 프라이어는 장면의 상대적 배치와 윤곽 정보를 보존하면서 재구성 파이프라인이 요구하는 제약을 피한다. 본 논문은 DepthAnything3의 계층적 특징을 기하학 토큰으로 변환해 DiT의 어텐션에 병렬로 주입했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






