스트리밍으로 25,000프레임까지 재구성 가능한 3D 재구성 파운데이션 모델
스트리밍 환경에서 paged KV 캐시와 Geometric Context Transformer를 결합하여 긴 영상 시퀀스의 실시간 3D 재구성을 구현한 파운데이션 모델이다.
TL;DR
LingBot-Map은 Geometric Context Transformer와 paged KV cache attention을 결합한 feed-forward 3D 재구성 파운데이션 모델로, keyframe 기반 캐시 관리와 windowed inference를 통해 수천에서 수만 프레임 길이의 스트리밍 비디오를 처리할 수 있다. FlashInfer 통합 시 JIT-compiled CUDA 커널로 페이지화된 KV 캐시를 활성화하여 실시간 성능을 개선하며, 배치 렌더러와 Kaolin 기반 CUDA 확장으로 25,000프레임 규모의 오프라인 포인트클라우드 영상을 생성할 수 있다. anchor context, pose-reference window, trajectory memory를 통해 장거리 드리프트를 보정하고 RoPE 훈련 범위를 초과하는 시퀀스는 windowed 모드로 안정적으로 처리할 수 있다. 환경 구성은 conda + PyTorch 2.8.0(CUDA 12.8)을 권장하며 FlashInfer와 Kaolin 설치가 권장된다.
주요 기능
- 스트리밍 실시간 추론을 지원하며 paged KV cache attention을 통해 프레임 캐시를 페이지 단위로 관리하여 수천 프레임 환경에서도 안정적인 메모리 거동을 보인다. 이 방식은 키프레임 전략과 결합되어 전체 KV 캐시가 크게 커지지 않도록 한다. FlashInfer가 설치되어 있으면 JIT-compiled CUDA 커널로 성능이 향상된다.
- 긴 시퀀스에서 발생하는 포즈 드리프트를 교정하기 위해 anchor context, pose-reference window, trajectory memory를 사용하여 로컬과 장거리 정합을 동시에 유지한다. 이들 구성요소가 결합되어 feed-forward 추론만으로도 장기간의 상태를 보존할 수 있다. windowed inference 옵션이 있어 시퀀스가 RoPE 훈련 범위를 초과할 때 윈도우 단위로 안정적으로 처리한다.
- 오프라인 배치 렌더링 파이프라인을 통해 매우 긴 비디오(예: 25,000 프레임)를 headless point-cloud MP4로 출력할 수 있다. 배치 파이프라인은 Kaolin 기반 GPU voxelization과 frustum culling용 CUDA 확장을 빌드하여 고성능 렌더링을 수행한다. sky masking용 ONNX 세그멘테이션을 통합해 야외 장면의 시각화 품질을 개선한다.
- 인터랙티브 viewer(viser)를 통한 실시간 시각화 옵션과 다양한 카메라 경로 YAML preset을 제공하여 재구성 결과를 즉시 관찰하고 카메라 워크를 설계할 수 있다. 카메라 YAML은 follow, birdeye, static, pivot 모드를 지원하며 transition으로 세그먼트 간 블렌딩을 조절한다. 렌더 파라미터는 CLI로도 오버라이드 가능하다.
- 메모리 제약 환경을 위한 운영 모드와 트레이드오프 조절 플래그들을 제공한다. 예를 들어 --offload_to_cpu를 통해 프레임별 예측을 CPU로 오프로드하거나 --camera_num_iterations을 줄여 카메라 헤드 반복을 축소하여 실행시간을 단축할 수 있다. keyframe_interval과 overlap_keyframes 등으로 캐시 성장과 크로스윈도우 정합을 세밀하게 조정한다.
어떻게 동작하는가
모델은 Geometric Context Transformer라는 단일 feed-forward 아키텍처로 동작하며 좌표 그라운딩과 조밀한 기하학적 단서를 입력으로 받아 즉시 포인트 클라우드 예측을 생성한다. 내부적으로는 paged KV cache attention을 사용해 키/값을 페이지 단위로 관리하고 anchor context, pose-reference window, trajectory memory를 통해 장거리 드리프트를 보정한다. 긴 시퀀스는 keyframe 전략과 windowed inference로 분할 처리하여 RoPE 훈련 범위를 벗어날 때도 포즈 정합성을 유지한다.
해결 문제
스트리밍 입력으로부터 긴 시퀀스 단위의 3D 장면 재구성에서 발생하는 메모리 폭발과 포즈 드리프트 문제를 줄이는 데 초점을 맞추었다. 페이징된 KV 캐시와 키프레임 기반 저장 전략으로 추론 메모리를 제어하며 윈도우드 모드로 훈련 범위를 넘는 시퀀스도 처리한다. 또한 배치 렌더러와 ONNX 기반 sky masking을 포함해 대규모 실험과 시각화 파이프라인을 함께 제공한다.
지금 주목받는 이유
최근 평가 벤치마크와 25,000프레임 장편 데모가 공개되며 스트리밍 장기 재구성 분야의 실무 적용 가능성을 입증한 점이 주목을 받았다.
차별점
- 페이즈별로 설계된 paged KV cache attention을 통해 긴 스트리밍 시퀀스에서 KV 캐시가 과도하게 커지는 문제를 실무적으로 제어한다. FlashInfer 통합 시 JIT-compiled CUDA 커널로 페이지 기반 캐시를 활성화하여 약 20 FPS 수준의 안정적 처리율을 달성할 수 있다. keyframe_interval과 overlap_keyframes 옵션으로 캐시 성장과 윈도우 경계 정합을 세밀하게 조정할 수 있다.
- Geometric Context Transformer가 좌표 그라운딩, dense geometric cues, 장거리 드리프트 보정을 하나의 feed-forward 모듈로 통합하여 스트리밍 환경에서 반복적 최적화 없이도 안정적인 재구성을 제공한다. anchor context와 trajectory memory가 결합되어 장기간 누적된 오차를 줄이는 구조적 장치를 제공한다. 이 접근은 전통적 반복 최적화 기반 시스템 대비 추론 속도와 스케일 측면에서 이점을 갖는다.
- 오프라인 batch_render 파이프라인을 통해 수만 프레임 규모의 비디오를 headless point-cloud MP4로 렌더링하는 엔드투엔드 워크플로를 제공한다. GPU voxelization과 frustum culling을 위한 CUDA 확장을 제공하며, Kaolin 호환성으로 고품질 렌더링을 지원한다. Sky segmentation을 ONNX 모델로 자동 다운로드하고 캐싱하여 야외 시각화를 개선하는 점이 통합된 실무 장점이다.
사용 사례
- 실내 및 실외에서 수천에서 수만 프레임에 달하는 비디오를 이용해 연속적인 3D 포인트 클라우드를 생성하고 시각화하는 용도로 적합하다. 제작된 출력은 포인트클라우드 flythrough 영상, 재구성된 포인트클라우드 파일, 프레임별 예측 NPZ로 저장되어 후처리 및 재렌더링에 활용될 수 있다.
- 자율주행 또는 로봇 내비게이션 연구에서 센서 스트림을 실시간으로 처리하면서 장거리 트래젝토리 정합을 모니터링하고 평가하는 실험 파이프라인으로 활용될 수 있다. keyframe과 windowed inference를 통해 긴 주행 로그를 메모리 한계 내에서 처리할 수 있다.
- 문화재 디지털 보존, 건축 현장 기록, 실내 매핑 등에서 긴 워크스루 영상을 고해상 포인트클라우드로 변환해 공간 스캔과 시각적 검토에 활용할 수 있다. YAML 기반 카메라 경로와 배치 렌더러를 통해 프리셋에 따른 영상 출력이 가능하다.
시작하기
먼저 conda 환경을 생성하고 python 3.10을 활성화한 뒤 PyTorch 2.8.0(CUDA 12.8) 권장 바이너리를 설치하는 것으로 시작한다. 프로젝트를 로컬에 설치하기 위해 pip install -e .을 실행하고 성능 최적화를 위해 FlashInfer를 설치하면 paged KV cache attention이 활성화된다. 설치가 완료되면 python demo.py --model_path /path/to/lingbot-map-long.pt --image_folder example/courthouse --mask_sky 같은 명령으로 예제 장면을 즉시 실행해 인터랙티브 viewer에서 결과를 확인할 수 있다.
요구사항
- Python 3.10 기반의 실행 환경을 권장하며 PyTorch 2.8.0과 CUDA 12.8 조합이 배치 렌더러와 Kaolin 호환성 측면에서 권장된다. FlashInfer가 권장 추론 백엔드이며 설치 시 JIT-compiled CUDA 커널이 첫 사용에 빌드되어 다양한 CUDA/PyTorch 조합에서 동작하도록 설계되었다. 오프라인 렌더링을 사용하려면 Kaolin, open3d, onnxruntime-gpu 및 ffmpeg와 GPU에서 빌드 가능한 CUDA 확장 빌드 환경이 필요하다.
이미지 분석

10.3k
Stars
1k
Forks
+209
Trending
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.