본문으로 건너뛰기

DF3DV-1K: Distractor-Free 신규 시점 합성을 위한 대규모 데이터셋 및 벤치마크

본 논문은 distractor-free radiance field 연구를 위한 대규모real-world 데이터셋과 체계적 벤치마크의 부재를 해소한다. 1,048개 장면과 89,924장의 이미지로 구성되며 128 distractor 타입과 161 시나리오 테마를 포괄한다. 이를 통해 9개 최신 distractor-free 방법과 3D Gaussian Splatting을 포함한 벤치마크를 제공하고, 시나리오별 차이와 모델 간 강건성 차이를 체계적으로 비교할 수 있다. 또한 다수의 샘플로 확장 가능한 2D 기반 엔하서 DI2FIX를 제시해, distractor-free 렌더링 품질을 평균 약 0.96 dB PSNR, LPIPS 약 0.057 감소로 향상시킨다.

왜 중요한가

본 논문은 distractor-free radiance field 연구를 위한 대규모real-world 데이터셋과 체계적 벤치마크의 부재를 해소한다. 1,048개 장면과 89,924장의 이미지로 구성되며 128 distractor 타입과 161 시나리오 테마를 포괄한다. 이를 통해 9개 최신 distractor-free 방법과 3D Gaussian Splatting을 포함한 벤치마크를 제공하고, 시나리오별 차이와 모델 간 강건성 차이를 체계적으로 비교할 수 있다. 또한 다수의 샘플로 확장 가능한 2D 기반 엔하서 DI2FIX를 제시해, distractor-free 렌더링 품질을 평균 약 0.96 dB PSNR, LPIPS 약 0.057 감소로 향상시킨다.

핵심 기여

DF3DV-1K 데이터셋 및 DF3DV-41 서브셋

1,048개 indoor/outdoor 장면, clean/clutter 이미지 쌍, 128 distractor 타입, 161 테마를 포함하고, 89,924장의 이미지를 제공한다. 데이터는 consumer 카메라로 수집되며 COLMAP 포즈 추정, Undistortion, instant-ngp를 통한 검증을 거친다.

대규모 distractor-free 벤치마크

9개의 최신 distractor-free radiance field 방법과 3D Gaussian Splatting, DF3DV-1K 및 DF3DV-41 벤치마크를 통해 RobustNeRF, On-the-go 대비 강건성 및 시나리오별 차이를 체계적으로 평가한다.

DI2FIX: 2D 확산 기반 엔하서

DIFIX 기반의 2D 엔하서로, DF3DV-1K*에서 수집된 대규모 데이터를 활용해 학습한다. 316,890개의 후보 쌍 중 LPIPS ≤ 0.5인 쌍을 정제하여 DI2FIX를 학습시키고, 다수의 렌더링 방법에서 평균 PSNR을 0.96 dB 올리고 LPIPS를 0.057 감소시켰다.

시나리오 기반 평가의 중요성

DF3DV-41은 17개 distractor/장면 시나리오를 통해 도전적 조건에서의 강건성을 평가한다. Semantically similar, fluid, nighttime 시나리오가 특히 어려움을 나타낸다.

핵심 아이디어 이해하기

단락 1: Dist distractors가 포함된 casual-capture 이미지에서 신뢰 가능한 3D 재구성을 방해하는 한계가 있다. 기존 데이터셋은 대개 per-scene 최적화 혹은 제한된 distractor 유형으로 일반화에 한계가 있다. 단락 2: DF3DV-1K는 각 장면에 clean과 cluttered 이미지를 함께 제공하고, 128개 distractor 타입과 161개 테마를 통해 실제 촬영 환경에서의 다양성과 난제를 반영한다. 데이터 수집 파이프라인은 Scene Design → Capture Setup → Data Curation의 3단계로 구성되며 COLMAP, undistortion, instant-ngp를 통한 품질 검증이 수행된다. 단락 3: 상용 모델들 간 차이를 평가하기 위해 9개 최신 distractor-free 메서드와 3DGS를 벤치마크에 포함시켰고, AsymGS와 RobustSplat이 대규모 벤치마크에서 상대적으로 더 강건함을 보인다. 단락 4: DI2FIX는 DF3DV-1K*를 이용해 학습한 2D 엔하서로, 다양한 방법에 일관된 개선을 제공하며 특히 난해한 사례에서 과도한 수정 없이 배경 정보를 보존하는 경향이 있다. 단락 5: DF3DV-1K의 규모와 다양성은 시나리오별 차이를 정밀하게 측정하고, per-dataset 추세가 논문 발표 순서와 일정 부분 일치하는 현상을 보인다.

관련 Figure

방법론

단락 1: 데이터셋 구성과 벤치마크 설계가 핵심이다. 1,048개 장면은 indoor 726/ outdoor 322로 구분되며 clean/cluttered 이미지 세트가 각 장면에 존재한다. 12개 소비자 카메라로 수집되며 해상도는 9개 수준이다. 라벨링은 161개 테마와 128개 distractor 타입으로 이루어진다. 3단계 파이프라인은 Scene Design, Capture Setup, Data Review로 구성된다. 단락 2: COLMAP으로 카메라 포즈를 추정하고 이미지 왜곡을 제거한 뒤 instant-ngp를 이용해 장면 재구성의 유효성을 검토한다. LPIPS 임계값 γ=0.5를 사용해 DF3DV-1K*에서 DI2FIX의 학습 데이터를 구성한다. 단락 3: 벤치마크는 10개 방법과 3DGS를 포함하며 PSNR/SSIM/LPIPS를 통해 평가한다. 단락 4: DI2FIX의 도메인 적합성은 Out-of-Distribution 테스트를 통해 확인되며, 10개 방법 각각에 대해 Training 데이터를 일부 빼고 학습해도 성능 변화가 작다. 단락 5: 250~1,007 장면 규모에서 DI2FIX의 성능이 증가하며, LPIPS 임계값의 선택이 성능에 영향을 준다.

관련 Figure

주요 결과

단락 1: DF3DV-1K 벤치마크에서 AsymGS, RobustSplat이 가장 강건하며, OCSplats와 DeGauss가 그 뒤를 잇는다. RobustNeRF 벤치마크 대비 DF3DV-1K/DF3DV-41은 더 도전적이며 PSNR/SSIM은 낮고 LPIPS는 증가한다. 표 3의 수치에 따르면 RobustNeRF 벤치마크에서 AsymGS는 PSNR 29.44, SSIM 0.896, LPIPS 0.096으로 최고 수준이며, On-the-go에서의 성능은 23.16(SSIM 0.821, LPIPS 0.136) 수준이다. DF3DV-1K의 평균적인 성능은 20dB대 초반으로, 시나리오 전 범위에서 일관된 강건성을 보이는 방법이 나타난다.

관련 Figure

기술 상세

단락 1: DF3DV-1K의 데이터 구조와 캡처 파이프라인의 전반적 아키텍처를 설명한다. 1048개 장면, indoor 726장면과 outdoor 322장면, clean과 cluttered 이미지 쌍, 89,924장의 총 이미지, 128 distractor 타입, 161 테마. Scene Design은 테마, distractor 유형, 커버리지, 뷰포인트 방향, 클린/클러터 이미지 수를 정의한다. Capture Setup은 약 12MP 해상도, 자동 노출/포커스, 흔들림 방지 해제 조건에서 수집된다. Data Curation은 COLMAP으로 포즈 추정 후 Undistortion, instant-ngp로 검증한다. S.2의 벤치마크 구성은 9개 distractor-free radiance field 메서드 + 3DGS. Tab. S.1~S.6에서 세부 통계 및 시나리오별 분석을 제공한다.

한계점

DF3DV-1K의 단점으로는 데이터 수집 비용이 높고, Fly-cloud 이동으로 인한 소량의 흐림 가능성이 언급된다. DI2FIX의 한계로는 극심한 저하 상황이나 cross-view confirmation bias에서 일부 수정이 실패할 수 있다.

실무 활용

DF3DV-1K는 distractor-free 3D 뷰 합성 연구의 실용적 데이터 소스와 벤치마크를 제공한다. DI2FIX 같은 2D 엔하서는 다양한 방법의 렌더링 품질을 개선하는 데 활용 가능하다.

  • 다양한 distractor-free radiance field 알고리즘의 강건성 비교 및 개선 방향 탐색
  • DI2FIX 같은 2D 기반 enhancer를 기존 모델에 Plug-and-Play 방식으로 적용
  • 실세계 casual capture 환경에서의 데이터셋 기반 학습 데이터의 확장성과 일반화 연구

코드 공개 여부: 공개

코드 저장소 보기

키워드

radiance-fields(빛의 방출장)distractor-free(방해물 제거)novel view synthesis(신규 시점 합성)diffusion-based 2D enhancer(확산 기반 2D 엔하서)gaussian-splatting(가우시안 스플래팅)PSNR(PSNR)LPIPS(LPIPS)3D Gaussian Splatting(3D 가우시안 스플래팅)

용어 해설

빛 방사장(Radiance Fields)
3D 공간에서 장면의 복사 광선 분포를 표현하는 표현으로, 신경방사장처럼 다수의 시점에서 일련의 이미지를 합성해 새로운 시점을 렌더링하는 기초 구성요소이다. 이 논문에서 distractor-free radiance field를 평가하는 데이터셋의 핵심 객체이다.
가우시안 스플래팅(Gaussian Splatting)
다차원 공간에서 가우시안 커널을 다수의 포인트로 근사하여 3D 재구성을 구현하는 기법으로, 3D Gaussian Splatting은 고해상도 실시간 렌더링에 활용된다.
DIFIX
확산(diffusion) 기반의 이미지 향상 프레임워크를 3D 렌더링에 적용하는 기술로, 디테일 보정과 노이즈 제거를 위한 2D 엔하서로 사용된다.
COLMAP
다양한 뷰에서의 카메라 포즈를 추정하는 구조-from-motion 도구로, 본 데이터셋의 포즈 추정 및 Undistortion에 활용된다.
온 더 고(On-the-go)
distractor-free radiance field 벤치마크의 하나로, 짧은 시간대의 이미지를 이용해 야외 포함 다양한 환경에서의 렌더링 품질을 평가한다.
DF3DV-1K
1,048개 장면으로 구성된 distractor-free 데이터셋으로, 각 장면에 clean과 cluttered 이미지 세트를 제공하며 128 distractor 타입과 161 테마를 포함한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 18.수집 2026. 06. 20.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.