TL;DR
람다형 구조의 래스터화된 floorplan과 불특정 뷰의 이미지 모음 간 정합 문제를 3D 재구성으로 해결한다. gravity-aligned 3D 재구성으로 얻은 2D 밀도 맵을 바탕으로 floorplan과의 전역 정합을 2D similarity transform으로 수행하므로, 대규모 건물이나 래스터화된 도면에서도 강인한 로컬라이제이션이 가능하다. 단일 뷰에서도 기존 방법 대비 성능이 크게 향상되며, interior/exterior 간의 일관된 정합도 가능하다.
왜 중요한가
람다형 구조의 래스터화된 floorplan과 불특정 뷰의 이미지 모음 간 정합 문제를 3D 재구성으로 해결한다. gravity-aligned 3D 재구성으로 얻은 2D 밀도 맵을 바탕으로 floorplan과의 전역 정합을 2D similarity transform으로 수행하므로, 대규모 건물이나 래스터화된 도면에서도 강인한 로컬라이제이션이 가능하다. 단일 뷰에서도 기존 방법 대비 성능이 크게 향상되며, interior/exterior 간의 일관된 정합도 가능하다.
핵심 기여
3D-grounded floorplan localization
무제한의 이미지 모음으로 gravity-aligned 3D 씬을 재구성하고 이를 orthographic 투영으로 2D density map으로 변환해 바닥계획의 프록시를 생성한다. 이 프록시는 2D floorplan과의 정합에 사용된다.
Cross-modal learning between density map and floorplan
Density map과 floorplan 간의 cross-modal 대응을 학습하기 위해 DINOv3를 LoRA로 미세조정하고, L_feat, L_regr, L_topo, L_geo의 합손실로 특징 매핑의 의미적 정합성과 구조적 일관성을 강화한다.
Robust 2D transform estimation via reliable correspondences
Density map과 floorplan 간의 신뢰도 기반 선택(top50)과 mutual nearest neighbor를 이용해 신뢰도 높은 대응점 집합을 구성하고, RANSAC으로 2D similarity transform M을 추정한다.
Sparse-view 및 exterior/interior 통합 성능
다수 뷰가 없더라도 강인하게 동작하며, interior와 exterior의 3D reconstructions를 바닥계획으로 공유 좌표계에 정합할 수 있다. Structured3D에서도 단일 뷰 로컬라이제이션과 비교해 최상위 성능을 보인다.
핵심 아이디어 이해하기
- 기존 Floorplan Localization은 벡터화된 floorplan과 discretized pose 공간의 순차 탐색에 의존하고, 대규모/래스터화된 도면에서 한계가 있다. 2) SceneAligner은 unconstrained 이미지 모음을 이용해 gravity-aligned 3D 씬을 재구성하고 이를 2D density map으로 투영해 floorplan의 추상 표현으로 삼는다. 3) density map과 floorplan 간의 cross-modal 대응은 2D foundation model(DINOv3)을 LoRA로 미세조정해 학습하며, feature matching 손실(Lfeat), 좌표 회귀(Lregr), 토폴로지(Ltopo), 기하(Lgeo)로 구성된다. 4) 신뢰도 기반 필터링과 mutual NN 매칭 후 RANSAC으로 2D similarity transform를 추정하고 이를 통해 3D 포인트와 카메라 포즈를 floorplan 좌표계에 정합한다. 5) 이 접근은 sparse-view에서도 강인하며, 실세계 내 다양한 건축 구조에서 바닥계획 로컬라이제이션의 정확도와 범용성을 크게 향상한다.
방법론
- 전체 아키텍처: 입력 이미지 I = {I1,...,IN}에서 π3 또는 VGGT 같은 3D foundation 모델로 3D 포인트 Pc_i와 상대 포즈를 얻고, GeoCalib으로 중력 방향 벡터를 예측한 뒤 reference 프레임으로 변환하여 g를 추정한다. 그 후 Gram-Schmidt로 y축과 일치시키는 rigid 변환을 적용해 gravity-aligned 3D 씬 Pg_i를 얻는다. 2) 2D Density Map 추출: Pg_i를 서로 다른 신뢰도 점수로 정제하고 수직 구조를 남겨 xz-평면에 직교 투영한 뒤 셀 단위로 포인트 수를 카운트하여 density map D를 생성한다. 3) Cross-modal 학습: Density map D와 floorplan F를 인코딩하는 공유 인코더 E(DINOv3 ViT-B/16)에 LoRA를 주입하고, L = λfeat Lfeat + λregr Lregr + λtopo Ltopo + λgeo Lgeo로 학습한다. 4) 매칭 및 정합: 상위 50%의 자신감 포인트를 사용해 MNN으로 교차 매칭 후 RANSAC으로 2D similarity transform를 추정하고, 이를 통해 3D 점 Pg*과 카메라 포즈를 floorplan 좌표계에 정합한다.
관련 Figure

density map과 floorplan의 매칭이 target region의 크기에 상관없이 작동함을 시각적으로 보여준다. 다양한 floorplan 구성을 다루는 방법론의 일반화를 보완한다.
다양한 타깃 영역 크기에 대한 floorplan 정합 예시
주요 결과
C3 데이터셋에서의 정합 성능: Angular Recall @5°/10°/20°/30°는 65.91/75.93/80.23/83.08, Positional Recall @5%/10%/20%은 50.87/65.58/76.08, Ang+Pos @(30°,20%)은 73.58이다. 비교 대상인 LoFTR은 4.67/8.31/15.11/22.80, 1.09/4.27/13.96/3.07, C3Po는 24.45/36.90/48.59/54.89, 16.60/28.59/42.12/32.96, DINOv3는 14.25/19.59/28.87/35.33, 6.75/14.23/26.67/18.28이다. PCK 및 RMSE에서도 Ours가 가장 높은 수치를 기록했다(예: PCK @1% 20.42, @3% 58.13, @5% 69.87, @10% 79.94, @15% 83.64, @30% 90.45, RMSE 0.0776). Structured3D indoor 단일-view 로컬라이제이션에서도 LASER/F3Loc/UnLoc 대비 상회하는 성능을 보인다(예: Ours 3.5/37.5/53.8/51.6). 추론 시간은 Ours(≤10)에서 143.7 ms로 C3Po 대비 빠르고, 150뷰 전체 처리 시 223.4 ms로 경쟁력 있다.
관련 Figure

dense photo 기반의 정합 예시를 보여주며 density map과 floorplan 간의 정합이 실세계 이미지에서도 효과적으로 작동함을 시각적으로 확인시켜 준다.
실제_dense_photo와 정합 결과의 예시
기술 상세
3D 재구성: π3 또는 VGGT를 이용해 3D 포인트 Pc_i와 relative camera poses를 추정한다. Gravity 방향은 GeoCalib로 per-image 예측 후 각 포즈로 변환해 medoid를 선택하고, Gram-Schmidt를 이용해 이를 수직 방향과 정렬한다. Density map 생성: Pg*의 outlier 제거(신뢰도 점수 기반) 및 수직 구조 유지로 gravity-aligned xz 평면에 orthographic projection 후 gamma 보정으로 D ∈ R^{H×W×1}를 얻는다. Cross-modal 학습: D와 floorplan F를 입력으로 하는 DINOv3(ViT-B/16) 기반 encoder에 LoRA를 주입하고, Lfeat, Lregr, Ltopo, Lgeo의 합손실로 학습한다. 학습 및 데이터: 140K density maps/샘플로 구성된 커리큘럼 학습; MR( Mixed-Resolution ) 전략과 0.7–1.0의 스케일 크기로 다중 해상도 학습 실시. Inference: 150개 이상 이미지 분할 처리 시 chunking으로 GPU 메모리 관리; density map에서 상위 50%의 신뢰 포인트를 추출하고 mutual NN으로 매칭 후 RANSAC으로 2D 변환 추정. 한 번의 변환으로 3D 포인트 및 카메라 포즈를 floorplan 좌표계로 변환한다.
관련 Figure

Fine-tuning된 모델이 density map과 floorplan 간의 의미적 정합을 개선하는 것을 PCA 시각화로 보여주며, cross-modal 학습의 효과를 시사한다.
2D foundation model 적응의 PCA 시각화
한계점
3D 재구성 모델의 오차는 density map 및 정합 품질에 영향을 미친다. density map은 글로벌 컨텍스트가 부족한 sparse-view에서 구조적 불확실성(예: 단일 입구, 대칭 구조)으로 인해 정합이 불안정해질 수 있다. rasterized floorplan의 비정형 구성에서 cross-modal 매칭의 한계가 존재한다.
실무 활용
바닥계획이 제공되지 않는 현장 사진 모음에서 Floorplan 기반의 글로벌 좌표계로 재구성할 수 있다. 3D 재구성과 2D 정합의 결합으로, 대규모 건축물의 로컬라이제이션 및 교차 도면 정합을 실용적으로 가능하게 한다.
- 현장 내비게이션 및 AR 애플리케이션에서 사진 모음의 위치 추정
- 골프장/유적지 등의 래스터화된 floorplan과 대형 야외 공간의 일치화
- interior-exterior 3D reconstructions의 공통 좌표계 구축
- disjoint 3D scene alignment를 통한 대규모 건축물 모델링
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Gravity Estimation
- — GeoCalib 등 모듈을 이용해 각 이미지의 중력 방향 벡터를 예측하고 상대 카메라 포즈로 변환한 뒤 medoid를 선택해 장면의 중력 방향(g)을 robust하게 추정한다. 이를 통해 재구성된 3D 포인트를 gravity-정렬된 좌표계로 정렬하고 수평면을 공유한다.
- Density Map
- — 그리드 셀 단위로 3D 포인트를 투영해 얻은 2D 표현으로, floorplan의 추상적 도식과 대응시키기 위한 프록시 역할을 한다. gamma 보정과 정규화를 거쳐 래스터화된 floorplan과의 정합에 사용된다.
- Cross-Modal Correspondence
- — Density map과 floorplan 간의 의미적 일치를 학습하기 위해 cross-modal 특성 매핑을 학습하는 방식으로, 2D foundation model의 특징 벡터를 서로 연관지어 정합성을 확보한다.
- LoRA
- — 대형 기반 모델의 가중치를 거의 고정한 채, 저차원 어댑팅 행렬 두 개를 학습시키는 방법으로, 본 논문에서는 DINOv3에 LoRA를 주입해 cross-modal 매칭 능력을 높인다.
- DINOv3
- — 2D foundation 모델로, density map과 floorplan 간의 특징 공간을 공유하도록 미세조정하며 cross-modal 매칭의 기초 특성 표현을 제공한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
