TL;DR
현실 환경의 시각 입력은 흐림, 왜곡, 어두움 등으로 변형된다. 기존 공간 벤치마크는 깨끗한 영상에 의존해 모델의 공간 추론 능력을 과대평가할 수 있다. SpaceDG는 9가지 degradations를 물리 기반으로 시뮬레이션하고 3D Ground-Truth를 유지한 상태에서 대규모 QA 쌍과 인간 검증 벤치마크를 제공한다. 이를 통해 degradation-aware training의 필요성과 강건한 공간 인지의 가능성을 제시한다.
왜 중요한가
현실 환경의 시각 입력은 흐림, 왜곡, 어두움 등으로 변형된다. 기존 공간 벤치마크는 깨끗한 영상에 의존해 모델의 공간 추론 능력을 과대평가할 수 있다. SpaceDG는 9가지 degradations를 물리 기반으로 시뮬레이션하고 3D Ground-Truth를 유지한 상태에서 대규모 QA 쌍과 인간 검증 벤치마크를 제공한다. 이를 통해 degradation-aware training의 필요성과 강건한 공간 인지의 가능성을 제시한다.
핵심 기여
Degradation-aware large-scale dataset SpaceDG
971,090 QA 인스턴스, 584개의 실제 실내 씬, 약 162K RGB 이미지, 9종 degradations를 4개 분류로 적용하고 3D Ground-Truth를 유지하는 자동화 파이프라인 구성.
SpaceDG-Bench: human-verified benchmark
11개 카테고리의 1,102개 고품질 질문, 9가지 시각 저하 유형, 1,725개의 이미지가 각 저하 조건에 매핑되어 9,918개의 VQA 페어를 생성.
Degradation-aware fine-tuning
SpaceDG-SFT로 1에폭 학습 시 깨끗한 입력과 저하 입력 모두에서 성능이 향상되며 degraded 조건에서 인간 기준을 넘어서는 경우도 관찰.
Degradation-wise analysis and CoT findings
저하 Attribution, Spatial Relation Distortion, Artifact-induced Error, Low-visibility Guessing의 4대 오류를 분석하고, 객체 중심 태스크가 저하에 더 민감하다는 점과 degradation-guided CoT의 효과를 제시.
핵심 아이디어 이해하기
출발점: 공간 지능은 2D 영상으로부터 3D 공간 관계를 추정하는 능력이다. 현실 세계의 입력은 Defocus, Distortion, Haze, Water Droplets, Low Light, Over-Exposure, JPEG Compression, Low Resolution, Motion Blur 등으로 왜곡되어 세부 기하 증거가 약해진다. 해결 원리: SpaceDG는 3DGS를 통해 기하를 보존한 채 9종 degradations를 물리적으로 합성하고, 자동 QA 파이프라인으로 Ground-Truth 3D를 활용한 QA를 생성한다. 또한 SAM3 기반 개체 설명과 covisibility 기반 뷰 샘플링으로 단일/다중 뷰 질문을 구성하고, degradation-aware training으로 저하 환경에서도 robust한 공간 추론을 학습한다. 달라진 점: degradation-aware SFT는 깨끗한 입력에서도 성능 저하를 줄이고 degradations에 따른 예측 불확실성을 감소시킨다. 또한 객체 수준의 세부 인식이 저하에 더 취약함을 밝히고, 글로벌 기하 추론은 상대적으로 덜 민감하다는 점을 확인한다.
방법론
- 데이터 엔진: 3DGS 기반의 기하 일관된 장면 재구성, DepthAnything-v3 및 COLMAP으로 깊이와 카메라 포즈 추정, SAM3로 마스크를 얻고 뷰 간 객체를 3D 인스턴스로 연결. covisibility 기반의 쌍 이미지 샘플링으로 단일 뷰/다중 뷰 QA를 구성. Ground-truth은 extrinsics, 3D 박스 중심, 물체 확장 등으로 산출. 2) Degradation 합성: Defocus/Distortion은 프리 렌더링, Haze/Water Droplets/Low-light/Over-exposure/JPEG/Low-res는 포스트 렌더링으로 적용. 3) QA 초기화: 3D 인스턴스에 대해 SAM3 마스크의 설명을 생성하고, 템플릿으로 QA를 구성한 뒤 자동 계산된 정답으로 Ground-Truth를 확보. 4) 평가 설정: Degradation Prompt를 통해 저하 정보를 제공하고 모델의 저하 인식 및 Reasoning에 미치는 영향을 분석. 5) 학습/검증: SpaceDG-SFT로 Qwen3-VL-8B-Instruct 및 InternVL-3.5-8B를 1에폭 학습, 8×GPU 사용.
관련 Figure

Figure 1~3의 구성 도식은 SpaceDG의 데이터 엔진과 ground-truth 유지 원리를 시각적으로 보강한다.
SpaceDG 개요: 9가지 degradation과 3개의 spatial task group, 데이터 엔진 구성

저하 합성의 물리적 구성과 QA 쌍 생성을 한눈에 보여주며 degradation 파이프라인의 구현을 설명한다.
Four degradation categories 및 degradation QA 예시
주요 결과
메인 벤치마크에서 SpaceDG-SFT-Qwen3-VL-8B-Instruct의 평균 정확도는 66.1%로, 깨끗한 입력 73.2% 및 degradations 조건에서 66.1%를 달성했다. 인간의 degraded 기준은 59.5%였다. Ablation 결과에선 No-SFT의 Avg가 42.1%였고 Full-SFT(저하 포함) Avg는 66.1%, Full-SFT(깨끗한 이미지) Avg는 64.8%로 나타났다. 저하 유형 가운데 Low-light와 Haze가 가장 큰 성능 저하를 유발하며, Object-centric 태스크가 특히 민감하다. CoT 실험에서 degradation-guided CoT의 효과는 일관되게 증가시키진 못했고, 특정 구성에서 약간의 성능 저하를 보이기도 했다. 인간대 모델 비교에서 SpaceDG-SFT는 degraded에서 인간 대비 격차를 좁히지만 여전히 완전한 로버스트를 달성하진 못한다.
관련 Figure

저하 Attribution, Spatial Relation Distortion, Artifact-induced Error, Low-visibility Guessing의 구체적 사례를 제시해 SpaceDG의 한계와 개선 방향을 시사한다.
저하로 인한 오류 유형 4가지
기술 상세
SpaceDG 엔진은 3DGS 기반의 기하 일관성 렌더링과 물리 기반 degradations 파이프라인으로 구성된다. Defocus/Distortion은 프리 렌더링으로 적용하고, Haze, Water Droplets, Low-light, Over-exposure, JPEG, Low-res는 포스트 렌더링으로 적용한다. QA 초기화는 SAM3 마스크를 이용한 per-instance 설명과 covisibility 기반 뷰 페어 선정을 통해 구성되며 Ground-Truth는 3D extrinsics 및 물체 박스 정보를 통해 산출한다. Degradation Prompt 템플릿과 degradation-aware CoT 실험은 저하 조건에서의 추론을 분석한다. SpaceDG-SFT는 971k QA, 160k+ 이미지로 구성된 데이터에서 1에폭 학습한다.
한계점
ScanNet++ 기반의 indoor 환경에 한정되며 9종 degradations만 다룬다. rain, snow, lens flare 등 추가 저하 유형은 미포함이며, 3DGS 기반 합성의 편향 가능성 및 실제 극단적 복합 저하에 대한 일반화 한계가 존재한다.
실무 활용
실무적으로 degraded 입력에서도 안정적으로 공간 추론이 필요한 로봇-자율시스템 및 멀티모달 에이전트 개발에 SpaceDG 기반의 평가/훈련 체계를 활용할 수 있다.
- Degradation-aware evaluation for robotics navigation and manipulation
- Robust vision-language agents in real-world environments
- Degradation-aware fine-tuning data generation for multimodal models
- Benchmark-driven model selection under imperfect observations
- Development of robust spatial QA systems
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 3D Gaussian Splatting
- — 3D Gaussian Splatting은 다수의 가우시안 커널로 3D 장면의 기하를 근사적으로 표현하는 렌더링 기법으로, 공간 인지 연구에서 Ground-Truth 3D 정보를 유지하며 다 View 합성에 활용된다.
- Holi-Spatial
- — Holi-Spatial은 비디오 스트림으로부터 3D 공간 정보를 추출하고 3DGS를 구성하는 자동화 파이프라인이다.
- DepthAnything-3
- — DepthAnything 계열은 다양한 보정 및 추정으로 깊이 정보를 보강하고, 다중 뷰의 카메라 포즈 및 깊이를 정확히 추정하는 도구이다.
- MapAnything
- — MapAnything은 3D 점 프로젝션 및 다중 뷰 합성에서 깊이-포즈 일치를 돕는 자동화 도구다.
- ScanNet++
- — ScanNet++은 실내 장면의 고충실도 데이터셋으로 SpaceDG의 원천 데이터 소스이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.