본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Robbyant/lingbot-map

Python0 / 0

스트리밍 환경에서 paged KV 캐시와 Geometric Context Transformer를 결합하여 긴 영상 시퀀스의 실시간 3D 재구성을 구현한 파운데이션 모델이다.

TL;DR

LingBot-Map은 Geometric Context Transformer와 paged KV cache attention을 결합한 feed-forward 3D 재구성 파운데이션 모델로, keyframe 기반 캐시 관리와 windowed inference를 통해 수천에서 수만 프레임 길이의 스트리밍 비디오를 처리할 수 있다. FlashInfer 통합 시 JIT-compiled CUDA 커널로 페이지화된 KV 캐시를 활성화하여 실시간 성능을 개선하며, 배치 렌더러와 Kaolin 기반 CUDA 확장으로 25,000프레임 규모의 오프라인 포인트클라우드 영상을 생성할 수 있다. anchor context, pose-reference window, trajectory memory를 통해 장거리 드리프트를 보정하고 RoPE 훈련 범위를 초과하는 시퀀스는 windowed 모드로 안정적으로 처리할 수 있다. 환경 구성은 conda + PyTorch 2.8.0(CUDA 12.8)을 권장하며 FlashInfer와 Kaolin 설치가 권장된다.

핵심 포인트

  • 페이즈별로 설계된 paged KV cache attention을 통해 긴 스트리밍 시퀀스에서 KV 캐시가 과도하게 커지는 문제를 실무적으로 제어한다. FlashInfer 통합 시 JIT-compiled CUDA 커널로 페이지 기반 캐시를 활성화하여 약 20 FPS 수준의 안정적 처리율을 달성할 수 있다. keyframe_interval과 overlap_keyframes 옵션으로 캐시 성장과 윈도우 경계 정합을 세밀하게 조정할 수 있다.
  • Geometric Context Transformer가 좌표 그라운딩, dense geometric cues, 장거리 드리프트 보정을 하나의 feed-forward 모듈로 통합하여 스트리밍 환경에서 반복적 최적화 없이도 안정적인 재구성을 제공한다. anchor context와 trajectory memory가 결합되어 장기간 누적된 오차를 줄이는 구조적 장치를 제공한다. 이 접근은 전통적 반복 최적화 기반 시스템 대비 추론 속도와 스케일 측면에서 이점을 갖는다.
  • 오프라인 batch_render 파이프라인을 통해 수만 프레임 규모의 비디오를 headless point-cloud MP4로 렌더링하는 엔드투엔드 워크플로를 제공한다. GPU voxelization과 frustum culling을 위한 CUDA 확장을 제공하며, Kaolin 호환성으로 고품질 렌더링을 지원한다. Sky segmentation을 ONNX 모델로 자동 다운로드하고 캐싱하여 야외 시각화를 개선하는 점이 통합된 실무 장점이다.
  • 스트리밍 실시간 추론을 지원하며 paged KV cache attention을 통해 프레임 캐시를 페이지 단위로 관리하여 수천 프레임 환경에서도 안정적인 메모리 거동을 보인다. 이 방식은 키프레임 전략과 결합되어 전체 KV 캐시가 크게 커지지 않도록 한다. FlashInfer가 설치되어 있으면 JIT-compiled CUDA 커널로 성능이 향상된다.

이미지 분석

다중 실내 룸 재구성 결과를 상단 투영도로 표현한 티저 이미지로, 각 경로가 점구름 위에 오버레이되어 시퀀스 별 트래젝토리를 시각화하고 있다.
이미지는 여러 방을 연결하는 장거리 실내 워크스루의 포인트클라우드 재구성 결과를 보여주며, 서로 다른 색의 경로선이 모델이 추적한 카메라 궤적을 나타낸다. 포인트클라우드의 부분적 결손과 흩어진 데이터가 보이나 궤적이 넓은 영역을 커버하고 있어 모델이 긴 시퀀스에서의 위치 정합과 장거리 컨텍스트 보존을 목표로 설계되었음을 시사한다. 이미지 구성은 모델의 멀티룸, 긴 시퀀스 처리 역량과 시각화 옵션(trajectory overlay, per-scene render)을 강조하는 결과물로 보인다.
오프라인 렌더링된 긴 인도어 워크스루의 스냅샷으로, 상단에 '25000 / 25000 Frames'라는 표시가 있어 렌더링된 프레임 수와 전체 시퀀스 길이를 명확히 나타낸다.
이미지 상단의 프레임 카운트는 장편 시퀀스(25,000프레임)를 성공적으로 렌더한 배치 파이프라인의 능력을 시각적으로 증명한다. 프레임이 이어진 포인트클라우드 투영과 중앙에 오버레이된 궤적선은 windowed inference 또는 keyframe 전략을 통해 긴 시퀀스를 연결해 렌더링했음을 시사한다. 시각적으로는 대규모 시퀀스를 처리하는 동안에도 궤적과 장면 구조를 일관되게 유지하려는 설계 목표가 반영되어 있다.

10.3k

STARS

1k

FORKS

+209

TRENDING

0

조회수

watchers 10.3kopen issues 60Apache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.