robbyant/lingbot-map
LingBot-Map은 anchor context, pose-reference window, trajectory memory를 통합한 Geometric Context Transformer와 paged KV cache를 통해 장기 시퀀스에서 실시간에 가까운 스트리밍 3D 재구성을 지원한다.
TL;DR
LingBot-Map은 스트리밍 환경에서 장기간의 이미지·비디오 시퀀스로부터 실시간에 근접한 3D 재구성을 목표로 설계된 피드포워드 기반 파운데이션 모델이다. 아키텍처는 anchor context, pose-reference window, trajectory memory를 결합한 Geometric Context Transformer를 중심으로 구성되어 좌표 그라운딩과 장거리 드리프트 보정을 동시에 수행하며, 페이징된 KV 캐시를 통해 메모리 사용을 제어한다. README에 따르면 FlashInfer 기반의 paged KV cache attention을 활용해 518×378 해상도에서 약 20 FPS 수준으로 동작했으며 만 단위 프레임 이상의 긴 시퀀스에서도 안정적 추론을 유지했다고 표기되어 있다. 데모 스크립트는 이미지 폴더와 비디오 입력을 모두 지원하고 키프레임 인터벌과 윈도우드 모드를 통해 메모리 및 성능을 조정할 수 있으며, 외부 ONNX sky segmentation을 통한 하늘 마스킹 옵션으로 야외 장면의 시각화 품질을 개선하는 워크플로를 제공한다.
핵심 포인트
- 좌표 그라운딩, 밀집 기하학 신호, 장거리 드리프트 보정을 하나의 Transformer 기반 스트리밍 프레임워크로 통합한 아키텍처 구조가 중심 차별점이다.
- paged KV cache 기반의 메모리 페이징과 FlashInfer 통합을 통해 수천에서 만 단위 프레임의 장시퀀스에서 안정적 추론을 유지하도록 설계된 점이 실전 적용 관점에서 구별된다.
- 피드포워드 추론을 우선한 설계로 반복적 최적화 방식보다 처리 지연이 낮고 데모용 이미지·비디오 스트림에서 실시간 성능 목표를 달성하도록 최적화되어 있다.
- 외부 ONNX 모델을 자동으로 내려받아 캐시하는 sky masking 워크플로를 포함해 야외 데이터에 특화된 전처리 옵션을 제공한다.
이미지 분석

271
LIKES
0
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.