왜 중요한가
자율주행 시스템의 안전 검증은 다양한 센서 구성을 필요로 한다. 실제 운전 데이터는 센서 구성의 제약으로 데이터가 제한적이다. Sensor2Sensor는 monocular dashcam 영상에서 실제 AV 로그에 상응하는 다중 카메라 이미지와 LiDAR를 생성함으로써 데이터 부족 문제를 완화하고, 외부 데이터의 활용성을 높인다.
핵심 기여
4DGS 기반의 synthetic paired data 파이프라인
AV 로그로부터 4D Gaussian Splatting을 이용해 360도 multi-view 카메라와 LiDAR를 매칭하는 paired training 데이터를 합성한다. 이를 통해 dashcam 영상과 real AV log 간의 학습 대상을 제공한다.
멀티-센서, 멀티-뷰 diffusion 모델
입력 dashcam 영상으로 8-view 이미지와 LiDAR 포인트 클라우드를 동시 생성하는 conditional diffusion 아키텍처를 제시한다. 각 모달리티에 대해 VAE와 U-Net이 분리된 브랜치를 가지며 cross-sensor attention으로 일관성을 보장한다.
Cross-Sensor Attention 모듈
이미지와 LiDAR 특성을 하나의 토큰 시퀀스로 합쳐 self-attention으로 교환하여 multi-view, multi-sensor 일관성을 보장한다.
DAgger 기반 자동회귀 비디오 생성
초기 모델의 롤아웃 프레임에서 GT를 부분적으로 대체하여 모델이 자체 오차를 보정하도록 학습시키며, 프론트 뷰의 FVD와 FID를 개선한다.
핵심 아이디어 이해하기
출발점: monocular dashcam 영상은 360도 다중 뷰와 LiDAR 같은 다중 모달로 확장되기 어렵다. 기초 데이터는 paired training이 부족한 반면, 4DGS를 통해 AV 로그로부터 4D 장면 재구성을 수행하고, 이를 바탕으로 dashcam 뷰를 합성한다. 1) 4DGS 재구성으로 paired 데이터 확보; 2) VAE+U-Net 기반의 multi-view diffusion으로 8-view 이미지와 LiDAR를 동시 생성; 3) cross-sensor attention으로 이미지와 LiDAR 간 시각-기하 일관성 확보; 4) DAgger로 장면의 시퀀스적 일관성 향상. 이로 인해 monocular 입력에서도 multi-view 로그를 생성하는 cross-embodiment 센서 변환이 가능해진다.
방법론
단계1: Synthetic Sensor Simulation via 4DGS. 3DGS를 확장해 다중 선형/변형 객체를 포함한 4D 장면을 구성하고, 360도 뷰 포즈를 가진 가상 dashcam 렌더링으로 paired training 데이터를 생성한다.ExtrinsicIntrinsics를 real dashcam 분포에서 샘플링하여 데이터 다양성을 확보한다. 단계2: Multi-modal Diffusion Model for Sensors. 이미지 분기와 LiDAR 분기로 구성된 Latent Diffusion 기반 모듈은 각 모달리티에 대한 VAE와 U-Net을 두고, Cross-view Attn과 Cross-sensor Attn으로 뭉쳐진 토큰 시퀀스 간 정보를 교환한다. Third-party Camera Condition으로 dashcam 영상도 조건으로 입력한다. 단계3: Auto-regressive Video Generation. xt를 이용해 Ct, Lt를 예측하고, t-1의 생성 결과를 Conditioning으로 사용해 시퀀스 생성을 수행한다. DAgger를 도입하여 rollout을 확장하는 동안 모델의 출력을 점진적으로 GT에 맞추도록 학습한다.
관련 Figure

아키텍처 구성과 데이터 파이프라인 흐름을 보여주며_methodology를 직접 보강한다.
Sensor2Sensor 아키텍처 다이어그램 및 4DGS와 교차-센서 어텐션 구성
주요 결과
다중 뷰 이미지 생성에서 Fixed-Camera-to-AV 데이터셋 기준 Ours의 FID는 6.47, PSNR은 19.06, SSIM은 0.539, LPIPS는 0.316으로 최적이다. 비디오 생성은 FVD가 278.12로 최적이며, 프레임 단위 PSNR은 22.42, SSIM은 0.623, LPIPS는 0.186이다. LiDAR 생성에서 Chamfer Distance는 8.68로 개선(개선율 13.37%)이며, X-Drive 대비 더 적은 노이즈와 더 정확한 강체 및 배경 기하를 보여준다. 인간 평가에서도 Dashcam 데이터에서 이미지 선호도 83.46%, LiDAR 68.08%로 상위이다. In-the-wild 일반화에서도 Dashcam/Internet 데이터 모두에서 Ours가 X-Drive를 압도한다. ablation으로 VC가 FID를 6.47로 개선했고, LiDAR와 이미지의 공동 학습이 LPIPS를 0.316으로 향상시켰다. DAgger 도입은 Front-view FVD를 278.12, FID를 21.54로 개선한다.
관련 Figure

다양한 baselines 대비 이미지/LiDAR 일관성과 품질 향상을 시각적으로 증명한다.
Fixed Camera-to-AV 데이터의 8뷰 이미지 및 LiDAR 생성 결과 비교
기술 상세
전체 아키텍처는 두 축으로 구성된다. 첫째, 4DGS를 활용한 synthetic paired data 생성 파이프라인으로 다중 뷰 카메라 8대와 LiDAR를 ground-truth AV 로그와 정합되는 페어 데이터로 재구성한다. 4DGS 렌더링은 8개의 뷰와 LiDAR를 포함하는 3D Gaussian splats를 이용해 다이나믹 오브젝트를 표현하고, Dashcam 인트린식/익스트린식 파라미터를 샘플링한다. 둘째, 다중 뷰-다중 센서 생성을 위한 Latent Diffusion 기반 모델로, 이미지 분기와 LiDAR 분기가 각각 VAE로 잠재 공간에 매핑되고, Cross-view Attn 및 Cross-sensor Attn 모듈로 두 모달리티 간 정보를 실시간으로 교환한다. Third-party 카메라 조건은 9번째 뷰로 처리되며, 8개의 대상 뷰와 conditioning으로 연결된다. LiDAR는 VAE-생성된 Spin 이미지에 Diffusion을 적용하고, 최종적으로 LiDAR VAE Decoder로 재구성한다. DAgger는 비디오 생성에서 롤아웃 시퀀스를 GT 컨텍스트의 일부로 보정하는 학습 전략으로 사용한다. 학습은 128 TPU에서 AdamW 최적화, EMA 가중치, conditioning masking, 이전 프레임 conditioning의 확률적 드롭 등을 포함한다.
한계점
장기 롤아웃에서 시간적 드리프트가 남으며, 고해상도/장시간 시퀀스의 장기적 일관성은 여전히 도전이다. 더 강건한 장기 시퀀스 백본이나 더 넓은 시간 컨텍스트를 활용하는 확장 연구가 필요하다.
실무 활용
대규모 안전 검증 및 시뮬레이션 데이터 확장을 위한 고충실도 데이터 생성 파이프라인으로 실무에 활용 가능하다.
- AV perception 모델의 데이터 보강 및 성능 검증
- 다양한 dashcam 구성을 가진 운영 환경에서의 시뮬레이션 로그 생성
- 원시 monocular 영상으로부터 multi-view 카메라+LiDAR 로그를 자동 생성하여 벤치마크 확장
- 교차 플랫폼 데이터 합성으로 크로스-플랜 및 시뮬레이션 기반 안전성 평가
코드 공개 여부: 미확인
키워드
용어 해설
- 4D 가우시안 스플래팅(4D Gaussian Splatting)
- — 다중 프레임에서 4차원 공간 정보를 이용해 신(scene) 재구성을 위한 확장 가능한 가우시안 스플랫 모델. 자율주행 장면의 동적 요소를 실시간으로 렌더링하는 데 사용된다.
- 레이맵(raymaps)
- — 카메라 파라미터를 공간상의 광선(origin, direction)으로 표현하는 입력 포맷. 다중 뷰 생성 시 카메라 포즈 제어와 정합에 사용된다.
- 교차-센서 어텐션(Cross-Sensor Attention)
- — 이미지와 LiDAR 등 서로 다른 센서 모달리티의 특징을 하나의 시퀀스로 구성한 뒤 self-attention으로 상호 교류시키는 모듈.
- LiDAR VAE
- — LiDAR spin 이미지의 depth, intensity, elongation, validity를 잠재 공간으로 인코딩/디코딩하는 변분 오토인코더.
- DAgger
- — Autoregressive 비디오 생성을 위한 Dataset Aggregation 기법. 모델이 생성한 롤아웃 데이터를 함께 학습에 반영하여 시퀀스 안정성을 높인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.