TL;DR
현실 세계로 잘 일반화되는 내비게이션 정책은 고품질의 대규모 환경 데이터가 필요하지만 기존 스캔과 절차적 시뮬레이터는 시각적 현실감과 물리적 타당성 사이에서 상충관계가 나타났다. Image2Sim은 실제 촬영 이미지와 비디오를 실시간으로 변환해 확장 가능한, 물리적으로 실행 가능한 신경 시뮬레이터 데이터를 대량 생성하므로 데이터 병목을 완화한다. 이로 인해 단일 시뮬레이터 풀에 의존하지 않고도 제로샷 실환경 전이 성능을 유의미하게 향상시킬 수 있다는 점에서 중요하다.
왜 중요한가
현실 세계로 잘 일반화되는 내비게이션 정책은 고품질의 대규모 환경 데이터가 필요하지만 기존 스캔과 절차적 시뮬레이터는 시각적 현실감과 물리적 타당성 사이에서 상충관계가 나타났다. Image2Sim은 실제 촬영 이미지와 비디오를 실시간으로 변환해 확장 가능한, 물리적으로 실행 가능한 신경 시뮬레이터 데이터를 대량 생성하므로 데이터 병목을 완화한다. 이로 인해 단일 시뮬레이터 풀에 의존하지 않고도 제로샷 실환경 전이 성능을 유의미하게 향상시킬 수 있다는 점에서 중요하다.
핵심 기여
기하학적 근거를 분리한 실시간 신경 시뮬레이터 구축
Image2Sim은 관측으로부터 feed-forward 방식으로 3D feature-Gaussian 장면을 단일 패스에서 구성하고, 이 구조를 보존한 채 Geometry-Aware One-Step Pixel Flow로 파노라마 RGB-D를 실시간 합성한다. 이 설계는 관측에 의해 확보된 기하학적 증거를 훼손하지 않으면서 생성적 완성을 통해 빈 영역을 보완하므로 시각적 충실도와 물리적 타당성을 동시에 충족한다. 단일 RTX 4090 기준으로 약 40 FPS 수준의 파노라마 렌더링 속도를 달성해 닫힌 루프 학습에 적합하다.
완전자동화된 대규모 임베디드 데이터 엔진
프레임 단위의 3D 장면 구성과 충돌 인지 모션 엔진, VLM 기반 지침 생성기를 통합해 수동 주석 없이 상호작용 가능한 장면과 실행 가능한 궤적, 그리고 정렬된 언어 지침을 대규모로 생성한다. 연구자는 이 파이프라인으로 약 20K의 상호작용 장면과 10M 이상의 비전-언어-동작 샘플을 확보하여 확장 학습을 수행할 수 있다. 자동화된 프로세스는 장면 다양성, 관측 분포, 행동 레이블, 언어 주석을 결합해 정책의 일반화에 기여한다.
임베디드 학습에서 데이터 규모의 로그-선형 이득 관찰
이미지 기반 신경 시뮬레이션으로 생성한 데이터를 단계적으로 확장한 결과, 성공률(SR)이 훈련 샘플 수에 대해 로그-선형으로 증가함을 실험적으로 확인했다. R2R-CE 기반 실험에서 학습 샘플을 35k에서 10M으로 확장할 때 SR이 46.1에서 66.3으로 상승했고 SPL 또한 유의미하게 개선되었다. 이 결과는 내비게이션 일반화가 여전히 데이터 한계에 민감하며, 대규모 신경 시뮬레이션이 실질적 해결책이 될 수 있음을 시사한다.
핵심 아이디어 이해하기
출발점은 실세계 수준의 시각적 충실도와 물리적 실행 가능성을 동시에 확보한 대규모 환경 데이터가 부족하다는 관찰이다. 전통적 스캔 방식은 시각적 품질을 제공하지만 확장 비용이 크고, 절차적 합성은 확장성이 좋지만 시뮬레이터와 현실 간의 차이(sim-to-real gap)가 크다. 따라서 확장 가능하면서도 기하학적으로 근거 있는 장면 표현과 고품질 관측 합성이 동시에 필요하다.
해결 원리는 3D 공간의 '앵커링'과 화상의 '포토리얼 합성'을 분리하는 데 있다. 먼저 포즈된 RGB-D 프레임을 feed-forward Gaussian encoder로 리프팅해 위치, 크기, 회전, 불투명도, 색상, 의미적 특징을 갖는 3D feature-Gaussian 집합을 만든다. 이 표현은 관측 기반의 기하학적 근거를 명시적으로 보존하므로 충돌 검사와 경로 계획에 직접 사용될 수 있다.
두 번째 축은 관측이 드문 영역을 단일 단계로 보완하는 제너레이티브 렌더러이다. Image2Sim은 가우시안 투영으로 얻은 RGB-D 및 알파 맵을 알파-게이티드 노이즈 스케일로 섞어 소스 상태를 만들고, 이를 UNet+Transformer 병목 구조와 Alpha-gated 스킵, SPADE 유사 정규화를 통해 One-Step Pixel Flow로 목표 파노라마를 재구성한다. 학습은 MeanFlow 기반의 연속 시간 흐름 손실과 EMA 기반의 모멘텀 자가-증류를 결합해 단일 스텝에서 안정적으로 구조적 완성을 달성하도록 유도한다.
이 접근은 기존의 다중 스텝 생성이나 최적화 기반 신(scene) 재구성의 비용을 피하면서도 관측 근거 보존, 구조적 완성, 실시간 성능이라는 세 가지 요구를 동시에 만족시킨다. 결과적으로 생성된 환경은 항해용 그래프 구축, 충돌 인지 경로 계획, 그리고 VLM으로 주석화된 자연어 지침 생성까지 연계되어 대규모 학습 데이터 파이프라인을 완성한다.
방법론
전체 파이프라인은 세 가지 핵심 모듈로 구성된다. 첫째, feed-forward 3D feature-Gaussian 인코더는 포즈된 RGB-D 입력에서 DINOv3로 추출한 의미적 패치 특징과 경량 기하학 스트림(깊이, 법선, 레이 방향)을 융합해 Gaussian 예측 헤드를 통해 가우시안 원소 집합을 생성한다. 이 과정에서 가우시안 중심은 깊이로부터 결정적으로 역투영되어 메트릭 기하학에 앵커링된다.
렌더링 모듈은 alpha-gated source state로부터 One-Step Pixel Flow를 수행한다. 구체적으로 알파 맵에 따라 노이즈 스케일을 공간적으로 조절하고, 소스 상태 z_src를 구성한 뒤 UNet 기반 인코더로 압축한다. 그 후 Transformer 병목에서 전역 레이아웃과 누락 구조를 추론하며, AdaLN으로 시간 스텝을 주입하고 SPADE 유사 정규화로 의미 토큰을 통합해 업샘플링 단계에서 알파 피라미드로 스킵을 게이팅해 신뢰도 높은 투영 증거를 보존한다.
학습은 MeanFlow 연속시간 수식에 기반한 흐름 손실과 모멘텀 자가-증류를 결합한다. 네트워크는 z_t와 목표 관측 X_p로 정의된 확률 경로 상에서 평균 속도를 예측하고, JVP 기반 전향 모드로 시간에 대한 도함수를 효율적으로 계산해 흐름 손실을 최소화한다. 또한 EMA로 업데이트되는 교사 네트워크의 고품질 특성 맵과 학생을 정렬하는 자기-증류 항을 도입해 약하게 관측된 영역에서의 생성 안정성을 높인다.
모션 시뮬레이션은 Gaussian 장면을 복셀화해 탐색 가능 복셀 그래프를 구성하고, GPU 병렬 레이마칭으로 에이전트 점유 영역의 충돌 여부를 쿼리해 물리적으로 타당한 궤적을 샘플링한다. 경로 계획은 충돌 인지 비용과 경로 길이를 고려하는 NavFn 유사 플래너로 수행되며, pure-pursuit 컨트롤러가 이산 경로를 연속 실행 가능한 궤적으로 변환한다. 마지막으로 시뮬레이터는 이 궤적을 재생하며 시간 일관된 파노라마 RGB-D 시퀀스를 렌더링하고, VLM을 통해 각 매크로-스텝에 대응하는 자연어 지침을 자동으로 생성한다.
관련 Figure

이 그림은 기존 방식이 3D 메시 스캔, 시뮬레이터, 수동 주석에 의존해 확장이 어렵다는 점을 구조적으로 보여준다. Image2Sim 측은 포즈된 영상에서 feed-forward로 feature-Gaussian 장면을 구성하고 one-step 렌더러와 자동 주석 파이프라인을 연결해 규모와 물리적 타당성을 동시에 달성하는 워크플로를 제시한다. 논문의 핵심 설계 원리인 기하학적 앵커링과 생성적 완성의 분리가 이 다이어그램을 통해 명확히 드러난다.
전통적 내비게이션 데이터 파이프라인과 Image2Sim 프레임워크의 비교 다이어그램으로, 입력부터 시뮬레이터·주석·로봇 학습까지의 차이를 시각화한다.

이 도식은 Gaussian 장면을 복셀화하고 GPU 병렬 레이마칭으로 점유 여부를 쿼리해 탐색 가능 복셀 그래프를 구성하는 과정을 시각화한다. 그래프 기반 계획에서 충돌 인지 비용을 반영해 NavFn 유사 플래너로 경로를 생성하고 pure-pursuit로 실행 가능한 궤적으로 변환하는 흐름이 명시되어 있어 모션의 물리적 타당성을 확보하는 방법을 보여준다. 또한 재생된 파노라마 비디오에서 매크로-스텝을 추출해 Qwen3-VL 계열 VLM으로 지침을 자동 생성하는 전체 자동화 연결을 보강한다.
모션 시뮬레이션, 궤적 생성과 자동 지침 생성 파이프라인을 요약한 다이어그램으로, 복셀화·충돌 검사·그래프 기반 계획·VLM 주석 흐름을 연결한다.
주요 결과
파노라마와 핀홀 입력 모두에서 Image2Sim은 생성 기반 모델과 순수 가우시안 투영 기반 방법들 사이에서 균형 잡힌 성능을 보였다. RealSee3D-Real 같은 고노이즈, 희소 관측 데이터에서 파노라마 입력으로 Image2Sim은 PSNR 17.43, SSIM 0.470, 약 45.6 FPS를 달성해 AnySplat와 같은 가우시안 전용 접근보다 재구성 품질이 우수함이 확인되었다. 이 결과는 알파 기반 지도와 픽셀 플로우 결합이 노이즈가 큰 영역에서 구조적 완성 능력을 제공함을 의미한다.
교차 시뮬레이터 제로샷 내비게이션 평가에서 Image2Nav(이미지2심으로 학습된 에이전트)는 R2R-CE, RxR-CE, REVERIE-CE 벤치마크에서 강한 성능을 기록했다. 특히 R2R-CE Val Unseen에서 90° FOV 설정으로 SR 66.3과 SPL 61.5를 달성했고, 180° FOV로는 SR 70.3, SPL 65.6까지 상승해 동일한 Habitat 평가 환경에서 기존의 인-도메인 학습법을 능가했다. 이는 Image2Sim으로 생성한 데이터가 시뮬레이터 도메인 간 일반화 학습에 유용한 물리적·시각적·언어적 신호를 제공함을 시사한다.
데이터 스케일링 실험에서는 R2R, RxR의 원본 데이터와 결합해 이미지2심에서 생성한 샘플 수를 35k에서 10M으로 확장했을 때 성공률(SR)이 46.1에서 66.3으로 증가하는 로그-선형 추세가 관찰되었다. 이 증가 추세는 환경 수, 궤적 다양성, 렌더링 관측, 지침 다양성이 함께 확장될 때 정책 성능이 지속적으로 개선된다는 점을 지지한다. 실제 로봇 실험에서도 Image2Nav는 경로 추종 및 목표 지향 과제에서 기준 방법보다 더 높은 성공 횟수를 보였으며 이는 시뮬레이터 간 전이뿐 아니라 실환경 전이 가능성을 뒷받침한다.
관련 Figure

비교 이미지는 가우시안 전용 합성이 희소 관측에서 구멍과 노이즈를 남기는 반면 픽셀 플로우 정제가 구조적 결손을 채워 시각적 품질을 회복함을 보여준다. 이는 논문에서 주장한 기하학적 앵커링을 유지하면서 생성적 완성으로 빈 곳을 채우는 설계 효과를 직관적으로 보강한다. 시각적 예시는 정량 지표(PSNR, SSIM, LPIPS)와 함께 픽셀 플로우의 실효성을 뒷받침한다.
가우시안 스플래팅 출력과 픽셀 플로우 정제 결과를 실제 관측(ground truth)과 비교한 파노라마 시각화이다.

이 그래프는 훈련 샘플 수를 35k에서 10M까지 늘렸을 때 SR이 46.1에서 66.3으로 꾸준히 상승함을 수치로 제시해 데이터 확장의 성능 기여를 명확히 보여준다. 그래프의 로그 축 배치는 초기 증가가 크고 고스케일에서도 포화되지 않는 경향을 나타내며, 이는 내비게이션 일반화가 여전히 데이터 규모에 민감하다는 결론을 뒷받침한다. 해당 결과는 논문의 핵심 주장인 '대규모 신경 시뮬레이션이 임베디드 학습 성능을 지속적으로 개선한다'는 근거로 직접 연결된다.
훈련 데이터 규모에 따른 성공률(SR)의 로그-선형 증가를 보여주는 스케일링 법칙 그래프이다.
기술 상세
전체 아키텍처는 feed-forward Gaussian encoder, Geometry-Aware One-Step Pixel Flow 렌더러, 그리고 모션 시뮬레이션 및 지침 생성기로 구성된다. Gaussian encoder는 DINOv3로부터 추출한 의미적 패치 특징과 경량의 기하 스트림을 멀티스케일로 융합해 각 가우시안의 위치, 비등방성 스케일, 회전, 불투명도, 색상, 특징 벡터를 예측한다. 이 가우시안 중심은 깊이로부터 결정적 역투영으로 배치되어 메트릭 기하학을 보장한다.
픽셀 플로우 렌더러는 알파 게이티드 소스 상태를 구성하고 UNet 인코더와 Transformer 병목을 결합해 단일 단계로 목표 파노라마를 예측한다. 학습 손실은 연속시간 MeanFlow 기반의 흐름 손실, 알파 적응 가중치, LPIPS 지각 손실, 그리고 EMA 기반 교사-학생 자기-증류 항을 합산해 구성된다. 흐름 손실의 시간 도함수 항은 전향 모드 JVP로 효율적으로 평가해 고비용의 고차 미분을 회피했다.
모션 엔진은 Gaussian 장면을 복셀화하고 GPU 병렬 레이마칭으로 에이전트 점유 영역의 충돌 쿼리를 수행해 탐색 가능 복셀 그래프를 만든다. 그래프상의 경로 계획은 충돌에 민감한 비용을 포함해 NavFn 유사 방식으로 수행되며, pure-pursuit 컨트롤러로 이산 경로를 연속 실행 궤적으로 변환해 실제 가동 가능한 저수준 동작을 생성한다. 이 궤적을 재생하며 시간 일관된 파노라마 시퀀스를 렌더링하고, 각 매크로-스텝을 VLM(Qwen3-VL-32B-Instruct 등)으로 주석화해 자연어 지침을 생성한다.
훈련 및 구현 세부사항으로는 Matterport3D-360, RealSee3D, Structured3D를 혼합해 400K 반복으로 학습했고 A6000 Ada GPU 8대 환경에서 배치 사이즈 2로 수행했다. 세 단계 커리큘럼을 적용해 초기 100K 스텝에서 기하학 초기화, 이후 픽셀 플로우와 자기-증류, 마지막으로 고주파 정제를 적용했다. 제로샷 및 높은 샘플 규모 실험을 위해 Image2Nav는 Qwen3-VL-4B-Instruct 기반으로 미세조정되었고 대규모 데이터에서 닫힌 루프 DAgger 온라인 미세조정을 적용해 행동 정책을 강화했다.
관련 Figure

이 도식은 입력으로 들어오는 RGB-D, 깊이·법선·레이 방향 등의 기하학 스트림과 DINOv3 기반 의미적 패치 특징이 어떻게 멀티스케일로 융합되는지를 보여준다. 또한 alpha-gated fusion, Transformer 병목, AdaLN 및 SPADE 유사 정규화의 역할을 시각적으로 연결해 픽셀 플로우가 어떻게 관측 신뢰도를 반영해 보완 생성하는지를 설명한다. 해당 그림은 픽셀 플로우의 조건부 입력 설계와 학습 신호 흐름을 이해하는 데 직접적인 근거를 제공한다.
피드포워드 feature GS 인코더와 Geometry-Aware One-Step Pixel Flow 모델의 내부 구조를 상세히 나타내는 도식이다.
한계점
실시간 처리와 낮은 계산 비용을 위해 렌더러는 모델 용량과 생성 능력 사이에서 타협이 있으므로 극히 복잡한 장면에서의 생성력은 제한될 수 있다. 시뮬레이터는 내비게이션 수준의 물리적 타당성(충돌, 슬라이딩)을 다루지만 복잡한 접촉 동역학, 가동 객체, 인간-로봇 상호작용과 같은 고차원 물리 현상은 지원되지 않는다. 또한 VLM 기반 자동 지침 생성은 대규모 주석화를 가능하게 하지만 언어적 편향이나 의미적 불일치가 간헐적으로 발생할 수 있다.
실무 활용
Image2Sim은 연구자와 개발자가 대규모 상호작용 장면과 정렬된 비전-언어-동작 데이터를 자동 생성해 내비게이션 정책 학습용으로 사용할 수 있게 한다. 공개된 GitHub 저장소를 통해 코드와 모델 구성 요소를 제공하므로 재현과 확장 연구가 가능하다. 실시간 렌더링 성능과 충돌 인지 모션 엔진이 결합되어 닫힌 루프 행동 학습 파이프라인에 바로 통합할 수 있다.
- 대규모 비전-언어-행동 데이터가 필요한 Vision-Language Navigation(VLN) 및 행동 cloning 연구에서 훈련 데이터 생성에 활용할 수 있다.
- 새로운 실내 장면을 신속히 전환해 상호작용 가능한 시뮬레이터 풀을 확장하고 여러 시뮬레이터 간 전이 성능을 비교하는 벤치마크 구축에 사용할 수 있다.
- 로봇 연구에서 충돌 인지 경로 계획과 자연어 지침을 결합해 인간-로봇 상호작용 시나리오에 맞는 지침-행동 데이터셋을 자동으로 생성하는 데 응용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Feature-Gaussian
- — 포즈된 RGB-D 관측을 단일 패스에서 3차원 좌표계로 리프팅하여 각 가우시안에 위치, 크기, 회전, 불투명도, 색상과 압축된 특징 벡터를 저장하는 표현이다. 이 표현은 관측에 의해 측정된 기하학적 근거를 유지하면서 부족한 영역을 특징 기반으로 보완할 수 있게 해준다. Image2Sim에서는 장면의 지속적 3D 지오메트리와 의미적 단서를 동시에 담아 실시간 변환과 렌더링 입력으로 활용된다.
- Gaussian Splatting
- — 3차원 가우시안 원소들을 투영하여 이미지 좌표계에서 색상, 깊이, 특징 맵과 불투명도 누적값을 생성하는 렌더링 기반 기법이다. 포인트 기반의 관측을 부드럽게 합성하면서 관측된 기하를 보존하는 장점이 있어 실시간 렌더링 전용으로 자주 사용된다. Image2Sim은 이 방법으로 관측 근거를 보존한 뒤 제너레이티브 모델로 빈 영역을 완성한다.
- One-Step Pixel Flow
- — 확률적 확률 흐름(Flow) 관점에서 노이즈화된 가우시안 투영 상태를 목표 파노라마 관측으로 단일 단계에서 운반(transport)하는 신경망 매핑이다. 시간 연속 MeanFlow 손실로 평균 속도(average velocity)를 예측하여 다중 스텝 샘플링을 대체하므로 실시간으로 고해상도 파노라마 RGB-D를 생성할 수 있다. Image2Sim에서는 알파 기반 신뢰도 맵과 의미적 토큰을 조건으로 하여 3D 근거를 유지하면서 구조적 완성을 유도한다.
- Alpha-Gated Fusion
- — 가우시안 투영에서 얻은 누적 불투명도(alfa)를 신뢰도 가중치로 사용하여 고신뢰 영역은 투영된 증거를 보존하고 저신뢰 영역은 생성적 보정을 허용하는 융합 전략이다. 이 방식은 관측적 증거를 불필요하게 덮어쓰지 않으면서 생성 모델이 빈 공간을 채우게 한다. Image2Sim에서는 알파 피라미드로 멀티스케일 스킵을 게이팅해 안정적인 단일 스텝 합성을 가능하게 했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.