본문으로 건너뛰기

MetaView: 메트릭 스케일 인지 암묵적 기하학 프라이어로 단안 신뷰 합성을 구현한 확산 기반 프레임워크

MetaView는 DepthAnything3의 중간 특징을 암묵적 기하학 토큰으로 주입하고 RoPE에 z축 스케일 서브스페이스를 추가하여 단일 이미지에서 대범위 시점 전환을 일관되게 수행한다.

용어 해설

Diffusion Transformer(DiT)
DiT는 Transformer 구조를 이미지 토큰과 텍스트 토큰 쌍으로 처리하여 교차-어텐션으로 조건부 확률 분포를 학습하는 확산 기반 이미지 생성 백본이다. 이미지와 텍스트를 별도 스트림으로 패치화한 뒤 Q/K/V를 생성하여 self-attention으로 융합하고 RoPE로 위치 정보를 유지한다. 본 논문은 이 DiT 백본을 동결한 채 기하학 토큰과 병렬 어텐션을 추가해 공간 정보를 주입한다.
Rotary Positional Encoding(RoPE)
RoPE는 토큰 좌표를 회전 행렬 형태로 임베딩하여 Transformer의 어텐션 내에서 상대적 위치 정보를 보존하는 기법이다. 본문에서는 카메라 intrinsics/extrinsics와 z축 스케일을 RoPE의 하위 공간에 할당해 프러스텀 인지 및 스케일 앵커를 구현했다. RoPE의 하위분할을 통해 i, j, z 좌표를 각각 독립 서브스페이스로 인코딩하는 방식이 사용되었다.
암묵적 기하학 프라이어(Implicit Geometry Prior)
암묵적 기하학 프라이어는 명시적 재구성 없이 피드포워드 기하학 네트워크의 중간 특징을 토큰화하여 생성 백본에 결합한 상대적 기하학 정보이다. 이 프라이어는 장면의 상대적 배치와 윤곽 정보를 보존하면서 재구성 파이프라인이 요구하는 제약을 피한다. 본 논문은 DepthAnything3의 계층적 특징을 기하학 토큰으로 변환해 DiT의 어텐션에 병렬로 주입했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 13.수집 2026. 07. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.