Robbyant/lingbot-map
Python0 / 0
스트리밍 환경에서 paged KV 캐시와 Geometric Context Transformer를 결합하여 긴 영상 시퀀스의 실시간 3D 재구성을 구현한 파운데이션 모델이다.
TL;DR
LingBot-Map은 Geometric Context Transformer와 paged KV cache attention을 결합한 feed-forward 3D 재구성 파운데이션 모델로, keyframe 기반 캐시 관리와 windowed inference를 통해 수천에서 수만 프레임 길이의 스트리밍 비디오를 처리할 수 있다. FlashInfer 통합 시 JIT-compiled CUDA 커널로 페이지화된 KV 캐시를 활성화하여 실시간 성능을 개선하며, 배치 렌더러와 Kaolin 기반 CUDA 확장으로 25,000프레임 규모의 오프라인 포인트클라우드 영상을 생성할 수 있다. anchor context, pose-reference window, trajectory memory를 통해 장거리 드리프트를 보정하고 RoPE 훈련 범위를 초과하는 시퀀스는 windowed 모드로 안정적으로 처리할 수 있다. 환경 구성은 conda + PyTorch 2.8.0(CUDA 12.8)을 권장하며 FlashInfer와 Kaolin 설치가 권장된다.
핵심 포인트
- 페이즈별로 설계된 paged KV cache attention을 통해 긴 스트리밍 시퀀스에서 KV 캐시가 과도하게 커지는 문제를 실무적으로 제어한다. FlashInfer 통합 시 JIT-compiled CUDA 커널로 페이지 기반 캐시를 활성화하여 약 20 FPS 수준의 안정적 처리율을 달성할 수 있다. keyframe_interval과 overlap_keyframes 옵션으로 캐시 성장과 윈도우 경계 정합을 세밀하게 조정할 수 있다.
- Geometric Context Transformer가 좌표 그라운딩, dense geometric cues, 장거리 드리프트 보정을 하나의 feed-forward 모듈로 통합하여 스트리밍 환경에서 반복적 최적화 없이도 안정적인 재구성을 제공한다. anchor context와 trajectory memory가 결합되어 장기간 누적된 오차를 줄이는 구조적 장치를 제공한다. 이 접근은 전통적 반복 최적화 기반 시스템 대비 추론 속도와 스케일 측면에서 이점을 갖는다.
- 오프라인 batch_render 파이프라인을 통해 수만 프레임 규모의 비디오를 headless point-cloud MP4로 렌더링하는 엔드투엔드 워크플로를 제공한다. GPU voxelization과 frustum culling을 위한 CUDA 확장을 제공하며, Kaolin 호환성으로 고품질 렌더링을 지원한다. Sky segmentation을 ONNX 모델로 자동 다운로드하고 캐싱하여 야외 시각화를 개선하는 점이 통합된 실무 장점이다.
- 스트리밍 실시간 추론을 지원하며 paged KV cache attention을 통해 프레임 캐시를 페이지 단위로 관리하여 수천 프레임 환경에서도 안정적인 메모리 거동을 보인다. 이 방식은 키프레임 전략과 결합되어 전체 KV 캐시가 크게 커지지 않도록 한다. FlashInfer가 설치되어 있으면 JIT-compiled CUDA 커널로 성능이 향상된다.
이미지 분석

10.3k
STARS
1k
FORKS
+209
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.