왜 중요한가
다중 뷰 3D 재구성은 degraded 입력에서 성능이 크게 떨어진다. 기존 복원은 이미지 공간이나 VAE 기반 잠재 공간에 의존해 cross-view 기하 일관성을 크게 유지하기 어렵다. GARD는 기하학 인지 표현 공간에서 확산 기반 노이즈 제거를 수행해 3D 기하와 색상 이미지를 함께 회복하고, cross-view 일관성을 유지한 채 강건한 재구성을 실현한다.
핵심 기여
Diffusion-based restoration in geometry-aware feature space
GARD denoiser Sθ(·)는 frozen된 다-view 재구성 모델 F(·)의 geometry-aware feature 공간에서 degraded intermediate representations zdegK를 restored representations zresK로 매핑한다. 이를 통해 3D geometry와 RGB 이미지를 단일 순전파로 복원한다.
Multi-view latent diffusion with attention-based alignment
GARD denoiser는 DiTDH 기반의 multi-view latent diffusion 아키텍처로, frame-level attention과 cross-view global attention을 교차적으로 사용해 다-view 표현을 통합한다. interpolated flow matching loss와 attention alignment loss를 함께 학습해 cross-view 일관성과 기하 정합성을 확보한다.
Geometry-aware feature space의 우수성 증명
DA3의 feature 표현이 VAE나 DINOv2 기반 표현보다 더 geometry-aware하다고 실험적으로 입증한다. 고품질 입력과 degradations 하에서 PCK 기반의 cost volume에서 더 나은 매칭과 강한 로컬 구조 보존을 보인다.
RGB 이미지 디코더의 도입으로 이미지 복원과 3D 재구성의 동시 달성
DRgb 디코더를 추가로 도입해 denoised feature에서 HQ RGB 이미지를 재구성하고, 동시에 3D 기하를 예측하는 두 가지 디코더를 통해 한 프레임워크에서 이미지 복원과 3D 재구성을 함께 달성한다.
DA3 벤치마크에서의 실험적 검증
Pose estimation, 3D reconstruction, 이미지 복원에서 GARD가 단일-뷰 및 다중-뷰 baselines를 능가한다. 특히 degraded 입력에서의 AUC30, Overall 지표, PSNR/LPIPS, AbsRel 등 다양한 지표에서 일관된 개선을 보인다.
핵심 아이디어 이해하기
단락 1: 문제 정의와 한계 - 다중 뷰 3D 재구성은 degraded 입력에서 기하 정보 손실으로 cross-view 매칭이 불안정해진다. 일반적인 pixel-space 복원은 다-view 정보를 충분히 활용하지 못하고, VAE 기반 잠재 공간은 세부 정보의 보존에 한계가 있다. 따라서 기하 정보를 직접 보존하는 표현 공간에서 복원이 필요하다. 단락 2: 해결 원리 - GARD는 frozen된 multi-view reconstructor의 기하학 인지 표현 공간에서 denoising을 수행하는 diffusion 기반 모델을 도입한다. K번째 레이어에서 zKdeg를 zKres로 바꿔 나머지 레이어를 거쳐 D(·)로 기하 정보를 복원한다. 이를 통해 cross-view 정합성과 세부 기하를 동시에 보존한다. 단락 3: 달라지는 점 - pixel-space 복원이나 VAE 기반 접근보다 다-view representation 공간에서의 denoising이 cross-view 기하 일관성을 유지하면서 3D 기하와 이미지 품질을 동시에 개선한다. 또한 RGB 디코더를 이용해 HQ 이미지를 얻으므로, 3D 기하 회복과 이미지 품질 회복이 하나의 프레임워크에서 이뤄진다. 단락 4: 실용적 시사점 - DA3 벤치마크에서 제시된 정량적 개선으로, degraded 입력 조건에서도 pose estimation과 3D 재구성의 성능 저하를 줄이고 실세계 응용에 대한 견고성을 제공한다.
방법론
- 전체 접근 방식: DA3-GIANT-1.1 기반의 다-view 인코더 E(·)와 기하 디코더 D(·)를 가진 feed-forward reconstructor F(·)의 중간 표현 z를 GARD denoiser Sθ(·)로 보정한다. - 수학적 흐름: degraded 입력 Ideg를 E를 통해 zonk화하고, K층에서 zKdeg를 zKres로 복원한 뒤 남은 층을 통해 Zres를 얻는다. Zres는 기하 디코더 D와 RGB 디코더 Drgb에 입력되어 G = D(Zres), Ires = Drgb(Zres)로 출력된다. - 학습 손실: Lflow = E_{t,zKdeg,zKclean}[||v(zt,t) − v∗(zt,t)||^2], zt = (1−t)z˜Kdeg + t zKclean, t ~ U(0,1). v(zt,t) = vt = Sθ(zt,t), v∗(zt,t) = zKclean − z˜Kdeg. - 추가 손실: Lattn = − E A∗ log AJ, 글로벌 어텐션 매핑을 HQ 포인트와의 대응으로 정렬한다. 총 손실 L = Lflow + λattn Lattn. - 학습 설정: Hypersim + TartanAir으로 10에폭, 배치크기 8, GPU는 H100, α=0.3의 노이즈 파라미터, J=9의 글로벌 어텐션, 50 스텝의 Euler 솔버. - 추론: GARD는 50 스텝의 ODE 솔버로 zdeg을 복원하고, four feature levels M = {20,28,34,40}를 D/Drgb에 입력한다. - 구성요소: DA3-GIANT-1.1 백본의 K=18에 denoiser 삽입; four feature levels M = {20,28,34,40}. RGBDecoder는 DA3-BASE에 맞춰 재구성. - 대조군: pixel-space restoration, VAEMVD(VAEs 기반 다-view), VRT/FMA-Net 등과 비교.
관련 Figure

프레임워크의 동작 흐름을 시각적으로 요약하며, representation space에서의 denoising과 복원이 어떻게 3D 재구성과 이미지 복원을 연계하는지 직관적으로 보여준다.
GARD 프레임워크의 초기 데모 그림으로 degraded views/depths, degraded 3D point cloud, restored views & depths를 한 화면에 보여준다.

GARD denoiser의 학습 과정을 설명하는 핵심 도식으로, interpolated flow matching과 attention alignment의 연결고리 및 multi-view latent diffusion의 구성요소를 시사한다.
GARD denoiser training 및 architecture를 상세히 보여주는 다이어그램
주요 결과
- Pose estimation: DA3 벤치마크에서 GARD가 최고 AUC30를 달성. HiRoom/ETH3D/DTU/7Scenes/ScanNet++에서 각각 67.22/74.68/92.37/84.73/87.45의 AUC30를 기록하며, 기존 단일/다-view baselines를 능가한다. - 3D reconstruction: HQ 입력 조건에서 GARD가 Overall↓와 F-score↑에서 최상 성능을 보이며, 예를 들어 HiRoom에서 Overall 0.293, ETH3D에서 1.136, DTU에서 4.760, 7Scenes에서 36.08, ScanNet++에서 35.77의 수치를 달성했다(각 데이터셋의 비교군 대비 우수한 성능). - 이미지 복원: HQ 입력에서 PSNR이 21.89(HiRoom), 21.88(ETH3D), 21.25(DTU), 22.67(7Scenes), 22.19(ScanNet++)로, 단일-view보다 우수하고 VAEMVD보다도 상회하는 결과를 보였다. LQ 입력에서도 GARD가 상위권 성능을 유지한다. - Depth estimation: GARDBASE 대비 GARD의 AbsRel이 더 작고 δ1이 더 큰 경향을 보인다. HiRoom에서 AbsRel 0.048, δ1 97.2; ETH3D 0.036, δ1 98.4; DTU 0.057, δ1 96.1; 7Scenes 0.071, δ1 92.7; ScanNet 0.040, δ1 96.7. GARDBASE 대비 모든 데이터셋에서 개선을 보인다.
기술 상세
- 아키텍처: F(·)의 multi-view encoder E(·)와 geometry decoder D(·)를 고정된 백본으로 두고, K번째 레이어에서 GARD denoiser Sθ(·)를 삽입해 zKdeg를 zKres로 보정한다. 이어 L=l∈{lres}의 네 가지 레벨 Zres를 얻어 D와 Drgb에 전달한다. - 학습 원리: 흐름 매칭(flow matching) 손실은 zdeg를 zclean으로 매핑하는 velocity field v(zt,t)를 학습시키고, zt를 ODE 솔버로 적분해 HQ 표현으로 보정한다. - 어텐션 정렬: A J는 글로벌 어텐션 맵으로 HQ 포인트 클라우드에서 유도한 A∗와의 cross-entropy로 정렬한다. - 데이터/학습: Hypersim + TartanAir으로 학습하고, 4 views를 사용하는 다-view 입력 설정에서 최적화한다. - 추론: 50 스텝의 Euler 솔버를 이용해 zdeg에서 zres로 변환하고, four levels M를 geometry RGB 디코더에 공급한다.
실무 활용
GARD는 degraded 입력에서도 3D 기하재구성 및 고품질 이미지 복원을 하나의 프레임워크에서 달성한다. 실세계 다중 뷰 시스템의 강건성 및 품질 보장을 위한 실용적 접근으로 활용 가능하다.
- 로봇 시각 시스템의 실시간 맵핑/로컬라이제이션에서 degraded 환경에 대한 강건성 확보
- 자율주행 차량의 저품질 영상에서도 3D 구조 재구성 개선
- 다중 카메라 설치 환경에서 cross-view 기하 일관성 유지가 필요한 엔지니어링 시나리오
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 확산(Diffusion)
- — 확산 모델은 노이즈가 더해진 상태에서 시작해 점진적으로 구조를 회복하며 샘플을 생성하는 생성 모델이다. 본 논문은 이 확산 원리를 다중 뷰의 기하학 인지 표현 공간에 적용해 degraded 표현을 HQ로 복원한다.
- 표현 자동 인코더(Representation Autoencoders)
- — RAE는 VAE와 달리 잠재 공간의 구조를 강화하기 위해 프리트레인된 표현 네트워크를 고정시키고, 고차원적이고 semantically rich한 latent 공간에서 확산 모델을 학습한다. 이를 통해 고해상도 재현에 유리한 표현 공간을 제공한다.
- Depth Anything 3 벤치마크(Depth Anything 3)
- — DA3는 다중 뷰 설정에서 깊이 추정·포즈 추정 및 3D 재구성을 평가할 수 있도록 설계된 벤치마크로, degraded 입력 조건에서의 성능을 검증하는데 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.