스트리밍 3D 재구성을 위한 Geometric Context Transformer
LingBot-Map은 anchor context, pose-reference window, trajectory memory를 통합한 Geometric Context Transformer와 paged KV cache를 통해 장기 시퀀스에서 실시간에 가까운 스트리밍 3D 재구성을 지원한다.
TL;DR
LingBot-Map은 스트리밍 환경에서 장기간의 이미지·비디오 시퀀스로부터 실시간에 근접한 3D 재구성을 목표로 설계된 피드포워드 기반 파운데이션 모델이다. 아키텍처는 anchor context, pose-reference window, trajectory memory를 결합한 Geometric Context Transformer를 중심으로 구성되어 좌표 그라운딩과 장거리 드리프트 보정을 동시에 수행하며, 페이징된 KV 캐시를 통해 메모리 사용을 제어한다. README에 따르면 FlashInfer 기반의 paged KV cache attention을 활용해 518×378 해상도에서 약 20 FPS 수준으로 동작했으며 만 단위 프레임 이상의 긴 시퀀스에서도 안정적 추론을 유지했다고 표기되어 있다. 데모 스크립트는 이미지 폴더와 비디오 입력을 모두 지원하고 키프레임 인터벌과 윈도우드 모드를 통해 메모리 및 성능을 조정할 수 있으며, 외부 ONNX sky segmentation을 통한 하늘 마스킹 옵션으로 야외 장면의 시각화 품질을 개선하는 워크플로를 제공한다.
핵심 역량
- 실시간에 근접한 스트리밍 추론으로 입력 이미지·비디오에서 연속적인 3D 포인트클라우드를 생성할 수 있다.
- 긴 시퀀스(README 기준으로 만 단위 프레임 이상)에 대해 메모리 페이징과 키프레임 간 수단을 통해 안정적인 재구성 결과를 유지한다.
- 영상 기반 좌표 그라운딩과 밀집 기하학 신호를 결합하여 국소적 정합 및 장기 드리프트 보정을 지원한다.
- 야외 장면에서 ONNX 기반 skyseg를 이용한 하늘 마스킹을 적용해 시각화 품질과 불필요 점 제거를 수행할 수 있다.
강점
- README에서는 스트리밍 및 반복 최적화 기반 접근법을 포함한 기존 방법들과 비교해 다양한 벤치마크에서 우수한 재구성 성능을 보였다고 명시되어 있어 실무 성능 측면을 강조한 근거가 존재한다.
알아두면 좋은 것
- Geometric Context Transformer는 anchor context, pose-reference window, trajectory memory를 단일 스트리밍 프레임워크로 통합하여 좌표 그라운딩과 장거리 드리프트 보정을 처리한다.
- 페이징된 KV 캐시(paged KV cache) 기반의 attention을 FlashInfer와 결합해 518×378 해상도에서 약 20 FPS 수준의 안정적 추론을 장기간(10,000프레임 이상) 수행했다고 README에 기재되어 있다.
- 데모 스크립트는 이미지 폴더와 비디오 입력을 모두 지원하며 키프레임 간격(--keyframe_interval)과 윈도우드 모드(--mode windowed)를 통해 장시퀀스 메모리 사용을 제어할 수 있다.
- 야외 장면 처리용으로 ONNX 형식의 sky segmentation 모델을 자동 다운로드해 캐시하는 워크플로를 제공하며 모델 체크포인트 용량은 약 4.63GB이고 라이선스는 Apache-2.0으로 표기되어 있다.
기술적 특징
- Geometric Context Transformer 구성은 좌표 그라운딩을 위한 anchor context, 과거 pose 참조를 위한 pose-reference window, 장기 일관성 유지용 trajectory memory를 결합해 프레임 간 공간적 연속성을 확보하도록 설계되었다. 이 설계는 로컬 관측치와 장기 메모리를 동시에 활용해 드리프트를 줄이는 목적을 갖는다.
- 페이징된 KV 캐시(paged KV cache)는 전체 키-값 상태를 메모리에 상시 유지하지 않고도 긴 시퀀스 문맥을 참조하게 하는 메모리 최적화 기법이며, FlashInfer 통합으로 실전 환경에서 518×378 해상도 기준 약 20 FPS의 안정적 추론을 달성하도록 구성되었다. SDPA로의 폴백도 지원해 FlashInfer 미설치 환경에서도 동작하도록 설계되었다.
- 피드포워드 기반 아키텍처는 반복적 최적화(optimization loop)에 비해 계산적 비용과 지연을 줄이는 방향으로 채택되었으며, 이로 인해 실시간 성능과 긴 시퀀스 처리에서 유리한 실행 특성을 확보했다. 페이징과 키프레임 전략을 통해 메모리 성장 문제를 제어한다.
- 데이터 전처리 및 시각화 측면에서 ONNX 기반 sky segmentation을 통해 하늘 영역을 제거하는 옵션을 제공해 야외 주행 데이터에서 원격 점의 시각적 잡음을 줄이고 결과물의 품질을 개선하는 작업흐름을 포함했다.
차별점
- 좌표 그라운딩, 밀집 기하학 신호, 장거리 드리프트 보정을 하나의 Transformer 기반 스트리밍 프레임워크로 통합한 아키텍처 구조가 중심 차별점이다.
- paged KV cache 기반의 메모리 페이징과 FlashInfer 통합을 통해 수천에서 만 단위 프레임의 장시퀀스에서 안정적 추론을 유지하도록 설계된 점이 실전 적용 관점에서 구별된다.
- 피드포워드 추론을 우선한 설계로 반복적 최적화 방식보다 처리 지연이 낮고 데모용 이미지·비디오 스트림에서 실시간 성능 목표를 달성하도록 최적화되어 있다.
- 외부 ONNX 모델을 자동으로 내려받아 캐시하는 sky masking 워크플로를 포함해 야외 데이터에 특화된 전처리 옵션을 제공한다.
이미지 분석

271
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.