TL;DR
대규모 비디오 기반 롤아웃은 상태 전이와 고주파 외관 합성을 결합해 긴 시간 동안의 일관성 유지가 어렵다. 이 논문은 상태 변수로 고정 길이의 렌더 가능 잠재인 Neural Implicit Scene(NIS)을 도입해 상태 전이와 포즈 조건 렌더링을 분리함으로써 재방문 일관성과 추론 효율을 동시에 개선했다. 훈련을 처음부터 수행해 보정 모듈나 사전학습된 비디오 백본 없이도 장기 일관성을 확보한 결과를 보고했다.
왜 중요한가
대규모 비디오 기반 롤아웃은 상태 전이와 고주파 외관 합성을 결합해 긴 시간 동안의 일관성 유지가 어렵다. 이 논문은 상태 변수로 고정 길이의 렌더 가능 잠재인 Neural Implicit Scene(NIS)을 도입해 상태 전이와 포즈 조건 렌더링을 분리함으로써 재방문 일관성과 추론 효율을 동시에 개선했다. 훈련을 처음부터 수행해 보정 모듈나 사전학습된 비디오 백본 없이도 장기 일관성을 확보한 결과를 보고했다.
핵심 기여
장면 중심 롤아웃 변수로서의 Neural Implicit Scene 제안
롤아웃 변수를 프레임 잠재에서 고정 길이의 렌더 가능 잠재 상태(NIS)로 대체해 상태 전이와 포즈-조건 렌더링을 분리했다. 이 분리는 상태 샘플링이 저주파 상태 전이에 집중하고 디코더가 고주파 외관 합성에 집중하도록 역할을 분담해 긴 시퀀스에서 재방문 일관성을 개선했다.
NIS-VAE와 NIS-DiT의 통합적 설계로 통일된 NIS 모달리티 확보
Transformer VAE인 NIS-VAE로 sparse posed views를 고정 길이 NIS로 인코딩하고, frozen encoder를 재사용해 pose-only, pose+reference, memory 조건을 모두 NIS 토큰으로 표현했다. 이어서 set-based diffusion transformer인 NIS-DiT가 이 NIS 조건들을 입력으로 받아 다음 로컬 NIS 상태를 샘플링한다.
지오메트리 기반 검색과 anti-drift 데이터 증강을 통한 장기 안정성 확보
히스토리 검색에서 카메라 거리와 FoV 중복, 최신성 우선 순위를 결합한 hybrid retrieval을 사용하고, 훈련 중 히스토리 이미지를 블러·해상도 저하·VAE 재구성 등으로 훼손해 학습시켜 생성 히스토리의 품질 저하에 대한 회복력을 확보했다. 이와 함께 latent 수준의 노이즈 주입과 AdaLN식 모듈레이션으로 DiT가 불완전 조건에 적응하도록 했다.
핵심 아이디어 이해하기
대부분의 기존 카메라 제어 비디오 생성기는 미래 관찰을 프레임 단위 잠재로 직렬 롤아웃해 상태 전이와 외관 합성을 동시에 수행했다. 이 방식은 롤아웃 길이가 증가할수록 외관 노이즈와 상태 드리프트가 누적되어 재방문 시 일관성이 크게 저하되는 문제가 발생했다. 특히 고주파 외관 정보가 상태 전이에 얽히면 장기 포즈 일관성을 보장하기 어려웠다. 이러한 문제를 해결하기 위해 이 논문은 상태 변수를 '고정 길이, 렌더 가능'한 Neural Implicit Scene(NIS)로 정의했다. NIS는 여러 쿼리 포즈에 대해 동일한 상태에서 일관된 관찰을 렌더할 수 있는 토큰 집합이다. 이로써 한 interaction step은 확률적 NIS 상태 샘플링과, 그 샘플에 대한 결정적 포즈 조건 렌더링으로 인과적으로 분리되었다. 상태 전이는 저주파적 장면 변이 정보를 담당하고 디코더는 고주파적 외관 합성을 담당하므로 두 과정의 역할 충돌이 완화된다. NIS를 단순한 NVS 조건이 아니라 상태 변수로 사용하면 재방문 시 동일한 NIS를 재활용해 장기 일관성을 유지하기 쉬워진다. NIS의 학습과 샘플링 측면은 각각 NIS-VAE와 NIS-DiT로 구체화되었다. NIS-VAE는 pose와 이미지 정보를 결합한 이미지-레이 필드를 패치화해 Transformer 인코더로 처리한 뒤 학습 가능한 쿼리 슬롯에서 μ,σ를 추정해 z∈ℝ^{L×D} 형태의 고정 길이 잠재를 얻는다. 이렇게 얻은 NIS는 디코더가 타깃 포즈의 레이 토큰을 NIS 토큰에 어텐션하여 RGB 패치를 생성할 수 있도록 한다. NIS-DiT는 집합 형태의 토큰에 직접 작동하는 diffusion transformer로서, 노이즈화된 잠재 z_t와 partial NIS 및 memory NIS 조건을 받아 velocity를 예측해 깨끗한 NIS z_0로 복원하는 흐름을 학습한다. 이 과정에서 partial NIS는 pose-only, pose+reference 또는 메모리로부터 얻어지며 모두 동일한 NIS 모달리티로 매핑되어 조건 일관성을 확보한다.
방법론
전체 파이프라인은 세 단계로 구성된다: NIS-VAE 학습, NIS-DiT 학습, 그리고 인터랙션 시 히스토리 검색·샘플링·렌더링이다. 먼저 NIS-VAE는 여러 개의 context posed views를 이미지-레이 필드로 변환하고 이를 패치 토큰으로 만들어 Transformer 인코더에 투입한다. 인코더의 학습 가능한 L개의 쿼리 토큰은 posterior의 diagonal Gaussian 파라미터 μ,σ를 생성하고 reparameterization으로 z를 샘플링한다. 디코더는 z와 쿼리 포즈의 레이 토큰 간의 어텐션을 이용해 타깃 관찰을 재구성하며 MSE, Perceptual, GAN, KL 손실을 결합해 학습된다. NIS-VAE의 구체적 하이퍼파라미터로는 고정 길이 L=1024 토큰과 채널 D=64가 사용되었고 입력 이미지는 256×256으로 정규화되었다. NIS-DiT는 set-based diffusion transformer 구조를 채택해 NIS 토큰 집합에 직접 확산-복원 모델을 학습한다. 입력으로는 노이즈된 잠재 z_t, timestep t, 그리고 조건 번들 c(부분 NIS 및 메모리 NIS)가 들어간다. partial NIS는 채널 단위 concat으로 z_t에 결합되고 memory NIS는 토큰 단위로 이어붙여 denoiser가 모두에 어텐션하도록 한다. 목적함수는 flow-matching 형태로 velocity v^⋆=z_0−ε를 목표로 하고 모델은 v^를 예측해 L2 손실을 최소화한다. 학습 과정은 weak-to-strong 커리큘럼으로 구성되어 먼저 pose-only 조건으로 prior를 학습한 뒤 pose+reference, 마지막으로 memory를 추가해 history-aware 샘플링에 적응시키는 단계적 학습을 수행한다. 장기 안정성을 위해 geometry-aware retrieval과 anti-drift augmentation이 결합되어 사용된다. memory bank에서 후보를 선택할 때는 카메라 거리, FoV 중복, 최근성 가중치를 합산하고 포즈 다양성 제약으로 중복을 줄인다. 훈련 시 히스토리 이미지는 Gaussian blur, 해상도 저하 복원, 또는 VAE 재구성 대체로 인위적으로 훼손해 encoder가 불완전한 조건에 대해 견고하게 동작하도록 했다.
관련 Figure

이 그림은 논문의 핵심 설계인 '상태 전이(샘플링)와 포즈 조건 렌더링의 분리'가 어떻게 모듈 수준에서 구현되는지 연결 구조로 보여준다. frozen NIS encoder가 pose-only, pose+reference, history를 모두 동일한 NIS 모달리티로 맵핑해 NIS-DiT에 전달하는 흐름이 명확히 드러나며, 이는 unified conditioning이 pose 일관성에 기여한다는 정량적 결과와 직접 연결된다. 또한 캐시된 렌더링을 메모리에 저장해 반복 인터랙션에서 활용하는 파이프라인이 시각적 근거로 제공된다.
모델 전체 파이프라인 다이어그램으로 NIS 인코딩, 부분 NIS 조건화, 메모리 검색, NIS-DiT 샘플링 및 디코더 렌더링의 상호작용을 한눈에 정리한 Figure이다.
주요 결과
정량 평가는 Re10K 및 DL3DV의 테스트 분할에서 forward trajectory와 cycle revisitation 프로토콜을 사용해 수행되었다. Re10K의 장기 forward(200번째 프레임)에서는 NeuWorld가 회전 및 병진 pose error에서 최저값(R_dist=0.083, T_dist=0.141)을 기록했고 LPIPS 및 FID에서도 우수한 성능을 보였다. DL3DV의 경우 장기 설정에서도 전체 지표에서 상위권을 유지했으며 장기 병진 일관성에서 최상의 값을 보였다. 사이클 재방문 평가에서는 NeuWorld가 Re10K에서 LPIPS/SSIM 기반 재방문 자기일관성 최적값을 달성했고 반환 경로의 병진 오차에서도 경쟁력을 보였다. 효율성 측면에서 NeuWorld는 Re10K 사이클 프로토콜에서 평균 실행 시간이 약 3.24분으로 VMem·Gen3C(약 47.62분)보다 약 14배 빠른 추론 효율을 확보했다. 풍부한 절단적 실험(ablations)은 NIS 표현의 이점, 토큰 용량(L,D)의 영향, unified partial-NIS conditioning과 anti-drift augmentation의 중요성, 그리고 hybrid geometry-aware retrieval의 기여를 분리해 보여주었다. 예컨대 동일한 prior 학습 조건에서 NIS 기반은 latent-frame 기반보다 prior 학습 시간이 대폭 짧았고(FVD 86.20 vs 88.03, Prior Time 17.2h vs 78.0h) 토큰 길이 증가가 NVS 품질을 꾸준히 개선하는 반면 채널 폭 증가는 완만한 개선만 유도했다.
관련 Figure

이 Figure는 정량 지표에서 보고된 장기 일관성·재방문 품질 차이를 시각화한다. NeuWorld가 긴 경로에서 지오메트리와 외관을 상대적으로 잘 보존하는 경향을 보여주며, 특히 재방문 구간에서 구조적 붕괴나 색상 누적 오류가 적은 사례들이 포함되어 있다. 정성 사례는 수치적 메트릭(LPIPS, pose errors)과 일관된 경향을 보이며 실질적인 시각적 일관성을 보강한다.
정성적 비교 이미지 모자이크로 다양한 입력 장면에 대해 NeuWorld와 여러 비교 방법의 forward·return 프레임을 나란히 보여준다.
기술 상세
전체 아키텍처는 NIS-VAE(인코더-디코더 Transformer)와 NIS-DiT(set-based diffusion Transformer)로 구성된다. NIS-VAE의 인코더는 이미지-레이 필드를 패치화해 Transformer에 입력하고 학습 가능한 L개의 쿼리 슬롯에서 μ,σ를 산출한다. 이 μ,σ는 diagonal Gaussian posterior의 파라미터로 사용되어 reparameterization으로 z=μ+σϵ를 샘플링한다. 디코더는 z와 타깃 포즈로부터 생성된 레이 토큰 간 어텐션을 수행해 RGB 패치를 예측한다. 이 구조는 입력 관측 수에 의존하지 않는 고정 길이 NIS 토큰 집합을 제공해 이후의 set-based prior 학습에 적합한 표현을 만든다. NIS-DiT의 수학적 기반은 flow-matching 스타일의 노이즈 모델링이다. 구체적으로 깨끗한 잠재 z_0를 얻기 위해 먼저 z_0를 frozen encoder로 인코딩한다. 그 다음 t∼p(t)과 ε∼N(0,I)를 샘플링해 z_t = t·z_0 + (1−t)·ε를 구성한다. 이 문맥에서 입력값은 깨끗한 잠재 z_0와 임의 노이즈 ε이며 → 이 두 값을 가중합해 z_t를 만든다 → 모델은 예측값 v^로 velocity v⋆=z_0−ε를 근사하려고 학습한다 → 이 v^의 L2 오차를 줄이면 z_t에서 z_0로의 복원이 가능해진다. 시간 스텝 t와 조건 번들 c는 모델 입력으로 사용되며 AdaLN 스타일의 timestep 모듈레이션과 RMSNorm, Q,K 정규화를 포함한 U-shaped Transformer 백본이 채택되었다. 학습 과정은 weak-to-strong curriculum을 따른다. 초기 단계에서는 pose-only partial NIS로 prior를 학습해 안정적인 NIS 분포를 확보한다. 중간 단계에서 pose+reference partial NIS를 도입해 관찰 정렬을 강화하고 최종 단계에서 memory NIS를 추가해 히스토리 의존 샘플링을 학습한다. 이 스케줄 동안 무작위로 조건을 제거하는 방식으로 classifier-free guidance를 병행해 조건 없는 샘플링에 대한 견고성을 확보한다. Anti-drift augmentation은 훈련 시 히스토리 이미지 훼손(Gaussian blur, down/up 샘플링, VAE 재구성 대체)과 latent 수준의 노이즈 주입 z_cond ← z_cond + γη를 병행한다. 여기서 η∼N(0,I)이고 γ는 Beta 기반 분포에서 샘플링한 증강 강도이다. 학습 중 DiT는 γ를 입력으로 받아 다양한 조건 품질에 적응하도록 AdaLN 유사 모듈로 조정된다. 메모리 검색은 메모리 뱅크에서 후보를 선별할 때 미래 경로의 여러 포즈에 대해 FoV 중복과 카메라 거리 점수를 계산하고 다양성 제약으로 중복 프레임을 제거해 ℋ_k를 구성한다. 이러한 하이브리드 점수는 루프 클로저와 반환 경로 품질을 크게 향상시켰다.
한계점
실험은 정적 장면과 카메라 제어 인터랙션으로 엄격히 제한되어 있어 동적 객체나 행동 기반 상호작용에는 직접 적용 결과가 불확실하다. 현재의 NIS는 로컬·세그먼트 단위로 앵커링되는 구조로서 전역 지속 맵(global persistent map)을 유지하지 못한다. 논문은 이러한 국지적 한계를 명시적으로 인정하고 대규모 장면 합성이나 동적 환경 적용은 향후 과제로 제시했다.
실무 활용
NeuWorld는 정적 장면에서의 카메라 제어형 인터랙션에 적합한 장기 일관성 높은 시뮬레이션을 제공한다. 고정 길이 NIS와 분리된 샘플링·렌더링 파이프라인은 반복적 경로 탐색과 루프 클로저가 필요한 응용에서 추론 효율과 재방문 일관성을 동시에 확보한다. GitHub에 공개된 구현으로 연구 및 프로토타입 개발에 바로 활용 가능하다.
- 로봇·드론의 가상 시뮬레이션에서 카메라 경로를 따라 일관된 관찰을 생성해 센서 예측·테스트에 사용한다.
- 실내 탐색 시나리오에서 경로 계획 시스템의 시뮬레이터로 활용해 장기 재방문 안정성을 평가한다.
- 데이터 증강용으로 카메라 트래젝토리를 따라 다양한 뷰를 생성해 다중 뷰 학습 데이터셋을 확장한다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Neural Implicit Scene (NIS)
- — 고정 길이의 토큰 집합으로 장면을 표현하는 잠재 상태이다. 각 토큰은 카메라 관찰과 레이 정보가 결합된 표현을 담아 Pose에 따라 디코더로 렌더링될 수 있다. NIS는 프레임별 잠재 대신 장기 일관성을 유지하며 상태 전이와 포즈 조건 렌더링을 분리하는 핵심 수단이다.
- Diffusion Transformer
- — 확산 과정에서 노이즈를 제거하는 denoiser를 Transformer 구조로 구현한 모델이다. 입력 노이즈화된 잠재와 시간 스텝, 조건 토큰을 받아 원시 잠재로 복원하는 velocity를 예측한다. 이 논문에서는 NIS 토큰 집합의 상태 전이를 모델링하는 데 사용되어 샘플링 기반 롤아웃을 수행한다.
- Transformer VAE
- — Transformer 인코더로 이미지·레이 필드를 토큰화하고 학습 가능한 쿼리 슬롯에서 잠재의 분포(μ,σ)를 얻는 변분 오토인코더이다. 재구성 손실과 Perceptual/GAN/KL 규제를 결합해 renderable한 고정 길이 NIS를 학습한다. 이 구조는 NIS를 생성/복원 인터페이스로 제공하는 데 핵심 역할을 한다.
- Geometry-Aware Retrieval
- — 메모리 뱅크에서 회수할 히스토리 프레임을 카메라 거리, FoV 중복 및 연속성 가중치로 점수화해 선택하는 검색 전략이다. 미래 경로의 여러 샘플 포즈와 비교해 점수를 계산하고 다양성 제한으로 중복을 줄인다. 롱호라이즌에서 루프 클로저와 드리프트 보정에 기여한다.
- Classifier-Free Guidance (CFG)
- — 조건부 생성에서 조건을 무작위로 제거해 조건 유무 간의 차이를 이용하여 샘플을 조정하는 기법이다. NIS-DiT에서 조건을 10% 확률로 드롭해 조건 강도를 제어하고, 샘플링 단계에서 스케일을 사용해 응답을 조정한다. 조건이 불완전한 상황에서 강건한 샘플링을 가능하게 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.