TL;DR
CAD 모델을 단일 RGB 이미지에 정확히 정렬하면 로봇 조작과 증강현실에서 객체의 3D 위치·자세·비율을 즉시 활용할 수 있다. 기존 제로샷 접근은 시각적 외형에 크게 의존해 부분 가림과 시뮬레이션-실제 도메인 차이에 약했으나, SUFLECA는 NOC 약지도와 광범위한 실세계·합성 데이터로 특성 공간을 기하학적으로 정렬하여 이런 약점을 줄였다. 그 결과 서빙 비용과 메모리 부담을 낮춘 채 반복적인 포즈 보정 없이도 경쟁적 성능을 달성해 실시간 적용 가능성을 크게 높였다.
왜 중요한가
CAD 모델을 단일 RGB 이미지에 정확히 정렬하면 로봇 조작과 증강현실에서 객체의 3D 위치·자세·비율을 즉시 활용할 수 있다. 기존 제로샷 접근은 시각적 외형에 크게 의존해 부분 가림과 시뮬레이션-실제 도메인 차이에 약했으나, SUFLECA는 NOC 약지도와 광범위한 실세계·합성 데이터로 특성 공간을 기하학적으로 정렬하여 이런 약점을 줄였다. 그 결과 서빙 비용과 메모리 부담을 낮춘 채 반복적인 포즈 보정 없이도 경쟁적 성능을 달성해 실시간 적용 가능성을 크게 높였다.
핵심 기여
대규모 다중 데이터셋 기반 NOC 약지도 확장
674K 장면을 포함한 12개 실세계 및 합성 데이터셋을 통합해 NOC 약지도를 학습 데이터로 사용했다. 각 실장면에 유사 포즈의 합성 렌더를 보강하여 시뮬레이션과 실제 간의 시각적 차이를 줄이고 가림 패턴을 공유하게 했다. 이로 인해 저차원 밀집 특성들이 도메인에 강건하게 일반화되었다.
경량 DPT 기반 특성 모델과 NOC 헤드 설계
프리트레인된 인코더의 다중 스케일 패치 특성을 Dense Prediction Transformer로 융합하고 binned NOC 헤드로 학습해 공간적으로 부드럽고 기하학적으로 의미있는 저차원 디스크립터를 얻었다. NOC 헤드는 학습 시에만 사용되며 테스트 시에는 제거되어 계산 및 메모리 부담을 낮췄다. dim=384, m=64 설정의 기본 모델과 더 작고 빠른 SUFLECA-S 변종을 제공했다.
상호 k-NN 기반 매칭과 기하학적 합의 필터
이미지와 미리 렌더된 CAD 뷰의 특성 간 상호 k-최근접 이웃 매칭을 적용한 뒤, 이 후보들 사이에서 쌍별 거리 보존을 이용해 비등방성 스케일을 추정하고 합의 행렬의 주성분으로 인라이어 집합을 선택했다. 이 과정은 많은-대-일 및 기하학적 비일관성 대응을 제거해 RANSAC 기반의 Procrustes 등록 입력을 정제했다. 초기 스케일은 쌍별 로그 스케일의 최빈값으로 얻어 강인성을 확보했다.
제로샷 정렬에서의 효율성 개선
학습된 특성의 차원이 작고 NOC 헤드가 테스트 단계에서 제거되므로 대응 비용과 VRAM 사용량이 기존 제로샷 방법 대비 크게 감소했다. 논문에 기록된 단일 인스턴스 정렬 평균 소요는 0.53초이며 SUFLECA는 2178MB의 VRAM를 사용해 동작했다. 반복적 포즈 정제 단계를 생략해 전체 처리 파이프라인의 실시간 목표에 근접했다.
핵심 아이디어 이해하기
CAD-이미지 정렬 문제는 이미지 픽셀과 CAD 표면 점 사이의 3D 대응을 찾은 뒤 그 대응으로부터 9차원 변환(회전, 병진, 비등방적 스케일)을 회복하는 문제이다. 기존 제로샷 접근은 시각적 표현의 유사성에 의존해 특징이 외형 차이에 민감했고 그 결과 가림이나 도메인 차이에서 대응이 불안정했다. 따라서 대응 추출에 앞서 특징 공간 자체를 기하학적으로 정렬하는 것이 핵심 출발점이다.
방법론
SUFLECA는 두 축의 설계로 문제를 해결한다. 첫째, 프리트레인된 백본을 고정한 채 Dense Prediction Transformer를 통해 다중 스케일 패치 특징을 융합하고, binned NOC 헤드로 NOC 값을 분류·회귀하도록 약지도 학습한다. 학습 손실은 각 축에 대한 교차엔트로피와 예측 NOC에 대한 L1 회귀 항을 합친 형태로 구성되어 학습 중 특성들이 공간적으로 매끄럽고 기하학적으로 정보량을 유지하도록 유도한다.
관련 Figure

상단은 원본 RGB 프레임, 중단은 깊이 역투영과 SAM2 마스크로 얻은 NOC 오버레이, 하단은 동일 포즈로 렌더된 합성 샘플을 보여준다. 이 구성은 실세계-합성 쌍을 학습에 병합한 접근을 직관적으로 보여주며 SUFLECA가 도메인 차이를 줄이기 위해 합성 카피를 어떻게 생성했는지 근거를 제공한다.
학습 데이터 준비를 보여주는 예제로 입력 RGB, 유도된 NOC 맵, 그리고 합성 대응 렌더를 세 행으로 배치한 이미지이다.
주요 결과
주요 벤치마크 ScanNet25k의 NMS 프로토콜에서 SUFLECA는 범주 평균 33.4%와 인스턴스 평균 42.3%의 정확도를 기록해 기존 제로샷 최강 후보였던 ZeroCAD보다 범주 기준 10.3포인트, 인스턴스 기준 12.2포인트 개선을 보였다. 논문은 또한 동일 벤치마크에서 SUFLECA가 일부 경우에 감독 학습 방법들을 능가했음을 보고했으며 이는 대규모 NOC 약지도와 기하학적 필터의 시너지 결과로 제시되었다. 효율성 관점에서는 기본 모델이 단일 인스턴스 정렬에 약 0.53초, 최고 2178MB VRAM로 동작해 고차원 특징을 쓰는 경쟁 기법들보다 메모리와 시간에서 유리했다.
관련 Figure

좌표축은 초당 처리 객체 수와 범주별 정확도를 나타내며 원의 크기는 VRAM 사용량을 시각화한다. 그림에서 SUFLECA는 다른 제로샷 방법들보다 높은 정확도를 가지면서도 낮은 런타임과 작은 VRAM에 위치해 있어 논문이 주장한 효율성과 성능 향상이 시각적으로 확인된다.
여러 제로샷 CAD 정렬 기법의 정확도, 처리 속도, VRAM 요구량을 비교한 산점도이다.

각 열은 객체 범주별로 원본, 마스크, 검색된 CAD, 그리고 여러 방법의 결과를 나열해 정합 테두리를 시각화한다. 이 그림은 SUFLECA가 가림과 복잡한 장면 배경에서도 보다 일관된 기하학적 경계를 복원함으로써 정렬 품질을 향상시켰다는 논문의 정성적 근거를 보강한다.
다수의 입력 이미지에 대해 SUFLECA와 경쟁 기법들이 추정한 CAD 정렬 결과를 비교한 정성적 예시 모음이다.
기술 상세
문제 수식은 X_cam = R S X_cad + t 이며 이 식은 CAD 좌표계의 점 X_cad를 회전 행렬 R, 대각 비등방적 스케일 행렬 S, 그리고 평행이동 t로 변환해 카메라 좌표 X_cam을 얻는 변환을 정의한다. 변수 의미는 R이 SO(3)에 속하는 회전, S는 diag(sx,sy,sz)의 축 정렬 스케일, t는 3차원 평행이동이다. 입력-처리-출력 관점에서 이미지와 CAD 간 대응이 확보되면 이 식의 미지수 R,S,t를 Procrustes 계열의 회귀로 추정하고 결과 잔차로부터 정렬 품질 점수 S_fit = log det(Lambda)를 계산해 정렬 신뢰도를 산출한다.
한계점
논문이 명시한 주요 한계는 CAD 검색 정확도에 성능이 크게 의존한다는 점이다. 실제 실험에서 완전한 Scan2CAD 정답 대신 제로샷 검색으로 전환하면 인스턴스 정확도가 크게 떨어져 검색 모듈이 전체 파이프라인의 병목으로 작용했다. 또한 학습 데이터와 실험이 주로 실내 영역과 흔한 카테고리에 편중되어 있어 야외 장면이나 드문 객체 범주로의 확장성은 아직 검증되지 않았다.
실무 활용
SUFLECA는 포즈 주석이 부족한 상황에서 CAD 모델을 이미지에 정렬하는 제로샷 파이프라인으로 실무에서 로봇 인식 모듈이나 AR 객체 배치 모듈에 통합할 수 있다. 경량화된 특성 표현과 반복적 포즈 보정 생략으로 현장 환경에서의 추론 비용과 메모리 요구를 줄였다. 다만 CAD 검색의 정확도와 도메인 범위가 전체 성능의 병목이므로 실무 도입 시에는 강건한 CAD 검색 보조가 병행되어야 한다.
- 실내 로봇의 잡기 및 조작 작업에서 카메라 단일 프레임으로 대상 CAD의 9D 정렬을 빠르게 수행해 그리퍼 목표를 생성하는 데 사용될 수 있다.
- 증강현실에서 실제 장면에 CAD 기반 가상 오브젝트를 정밀하게 중첩시키고 크기·자세를 자동 보정하는 렌더링 파이프라인에 적용 가능하다.
- CAD 라이브러리와 결합한 자산 매칭 시스템에서 후보 CAD 정렬 품질을 자동 평가하고 순위를 매기는 검색 후 정제 단계로 활용될 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Normalized Object Coordinates (NOC)
- — 객체 표면의 각 점을 범주 수준의 기준 좌표계로 사영하는 표현이다. 이미지 픽셀을 카메라 좌표로 역투영한 뒤 CAD 표면 좌표와 대응시켜 3D 정렬 문제를 밀집 좌표 예측과 등록으로 환원한다. CAD 정렬에서 이미지와 CAD 간 기하학적 대응을 직접 학습하도록 유도하므로 도메인 간 일반화와 기하학적 일관성 확보에 핵심적이다.
- Dense Prediction Transformer
- — 프리트레인된 백본의 다중 스케일 패치 특성들을 융합하고 업샘플링하여 고해상도 밀집 특성 맵을 생성하는 구조이다. 입력 이미지의 다양한 해상도 수준 정보를 결합해 픽셀 단위 서술자를 생산하므로 NOC 예측과 대응 추출에 적합하다. SUFLECA는 이 모듈을 이용해 기하학적으로 균질한 저차원 특성 공간을 학습했다.
- Mutual k-Nearest-Neighbors
- — 이미지와 렌더 간 대응을 얻을 때 양방향으로 각각의 top-k 후보에 상호 포함되는 쌍만 선택하는 매칭 규칙이다. 단순 단방향 NN보다 중복과 많은-대-일 대응을 줄이면서도 과도한 보수성으로 인한 대응 손실을 완화한다. SUFLECA는 여기에 기하학적 합의 필터를 결합해 최종 인라이어 집합을 확보했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.