병렬 박스 디코딩으로 처리량을 끌어올린 고속 시각 그라운딩
LocateAnything-3B는 Qwen2.5-3B-Instruct 기반의 3B 파라미터 비전-언어 모델로서 Parallel Box Decoding을 통해 박스 좌표를 병렬 예측하여 실시간급 그라운딩과 고밀도 검출 작업의 처리량을 개선한다.
TL;DR
LocateAnything-3B는 Qwen2.5-3B-Instruct 언어 백본과 MoonViT 비전 인코더를 결합한 3B 파라미터의 비전-언어 모델로, 자연어 질의에 따라 박스와 포인트 형태의 위치 출력을 생성하도록 설계되었다. 핵심은 Parallel Box Decoding을 통해 좌표를 블록 단위로 병렬 예측함으로써 토큰별 autoregressive 과정을 줄이고 처리량을 향상시킨다는 점이며 README에서는 최대 약 2.5배의 처리량 이점을 보고했다. 학습은 약 12M 이미지와 138M 이상의 질의, 785M 바운딩박스를 포함한 대규모 멀티도메인 데이터로 이루어졌고 Fast/Slow/Hybrid 세 가지 생성 모드를 제공해 응용 요구에 따라 속도와 견고성 사이를 조절할 수 있다. 배포는 NVIDIA GPU 환경과 BF16/KV cache를 전제로 하며 TensorRT 등 일부 엔터프라이즈 런타임은 아직 공식 지원에서 제외되어 실제 도입 전 추가 검증과 런타임 최적화가 필요하다.
핵심 역량
- 이미지와 자연어 프롬프트를 입력으로 받아 정규화된 블록 기반 좌표 토큰으로 객체 바운딩박스와 포인트를 출력할 수 있다. 출력은 고정 길이 블록 구조를 사용하며 Semantic·Box·Negative·End 블록을 포함해 포맷 불일치 시에는 자동으로 패딩을 사용한다. Fast, Slow, Hybrid 세 가지 생성 모드를 통해 속도와 정확도의 균형을 조정할 수 있다.
- 지칭 표현 지향 그라운딩과 다중 인스턴스 검출을 모두 처리하며 GUI 요소나 문서 레이아웃 같은 고해상도 전문 도메인에서도 박스와 포인트 형식의 위치 응답을 생성할 수 있다. 모델은 원본 해상도를 보존한 입력 처리를 지원하므로 고해상도 입력에서의 미세한 공간적 결정을 유지한다. 포인트 출력은 박스 내부 좌표와 동일한 블록 토큰 포맷으로 정규화되어 후처리 파싱이 용이하다.
- 대량의 멀티도메인 학습 데이터를 바탕으로 오픈셋 및 롱테일 객체에 대한 일반화 성능을 확보했다. 학습 집합은 자연 장면, 로보틱스, 드라이빙, GUI, 문서 이해 등 여러 도메인을 포함해 다양한 공간 분포를 반영한다. 평가 스위트는 박스 F1@IoU 0.5/0.95와 mean IoU 및 포인트 기반 정확도를 포함해 영역별 성능을 측정한다.
- 배치 하이브리드 추론과 la_flash 같은 희소 범위 실행기를 통해 메모리 피크와 처리량을 최적화할 수 있다. MagiAttention 설치 시 MTP 블록 기반 연산을 가속하며 설치가 없어도 PyTorch SDPA로 기능 호환성을 유지한다. 모델은 BF16 및 KV cache를 활용해 GPU 가속 환경에서 안정적인 추론 성능을 낸다.
강점
- Parallel Box Decoding을 통해 박스 좌표를 블록 단위로 병렬 예측함으로써 토큰별 순차 디코딩 비용을 줄였고, 원문 기준으로 이전 방식보다 최대 약 2.5배 높은 처리량을 보고했다. 이 설계는 고해상도 입력과 다수 객체가 존재하는 장면에서 실질적인 BPS(boxes per second) 향상을 가능하게 했다. 병렬 예측은 박스 간의 기하학적 일관성을 유지하도록 블록 구조와 포맷 패딩을 도입해 품질 저하를 제한했다.
- 대규모 멀티도메인 학습 데이터와 다양한 라벨 소스를 조합해 오픈셋 및 롱테일 객체에 대한 일반화 성능을 확보했다. 학습 데이터는 자연 장면과 문서, GUI, 원격 감지 등을 포함하여 광범위한 공간 분포를 반영했고 이는 다양한 평가 벤치마크에서의 견고한 성능으로 이어졌다. 또한 native-resolution 입력 처리로 고해상도 레이아웃과 텍스트 위치화 같은 전문 도메인에서도 세밀한 위치 결정을 지원한다.
훈련 방식
기초 언어-비전 적응을 위한 캡셔닝·VQA·OCR 등 멀티모달 사전 적응 단계 이후에 그라운딩과 고밀도 장면 위치화로 세분화된 SFT(fine-tuning)를 수행했고, 합성 레이블과 모델 보조 라벨링을 혼합한 멀티도메인 데이터로 파인튜닝해 다양한 도메인에서 위치 추론 능력을 확보했다.
알아두면 좋은 것
- 모델은 Qwen2.5-3B-Instruct를 언어 백본으로 사용하고 MoonViT를 비전 인코더로 조합한 native-resolution VLM이다. 전체 파라미터 수는 3B이며 출력은 블록 기반 구조로 시공간 좌표를 정형화해 처리한다. Fast/Slow/Hybrid 세 모드가 제공되어 현장 요구에 따라 속도와 견고성 사이를 조정할 수 있다.
- 학습에 사용된 멀티도메인 데이터셋은 약 12M 이미지, 138M 이상의 질의, 785M 바운딩박스로 기술되어 대규모 정밀 위치화 학습 목표를 반영한다. 라벨링은 인간 주석과 모델 보조 합성을 혼합했으며 공개 데이터와 합성 데이터가 혼재되어 있다. 이 데이터 스펙이 모델의 도메인 범용성과 긴 꼬리 객체 일반화에 기여했다.
- 배포 환경은 NVIDIA GPU 최적화를 전제로 설계되어 H100/A100 등에서 평가가 이루어졌고 BF16과 KV cache 기반의 추론 파이프라인을 권장한다. TensorRT·TensorRT-LLM·Triton은 아직 공식 지원에서 제외되어 있으며 MagiAttention과 la_flash 같은 선택적 가속 라이브러리를 통해 추가 속도 개선이 가능하다. 모델은 연구 및 개발 목적의 네비디아 라이선스 하에 공개되어 있다.
- 출력 블록은 길이 6 포맷으로 구성되며 박스 블록은 정량화된 좌표와 구조 토큰으로 인코딩되어 있다. Fast Mode는 MTP(병렬 토큰)만 사용해 가장 빠른 응답을 내고 Slow Mode는 완전한 NTP/AR을 사용해 가장 높은 견고성을 보인다. Hybrid Mode는 기본값으로 MTP 우선 후 불확실성 시 AR로 폴백해 안정성과 속도를 모두 확보한다.
기술적 특징
- Parallel Box Decoding은 박스 좌표와 관련 토큰을 고정 길이 블록으로 묶어 동시에 예측하는 구조로 동작한다. 이 방식은 토큰 단위의 autoregressive 디코딩을 제거하거나 폴백 수준으로 축소해 디코딩 스텝 수를 줄였고, 그 결과 높은 처리량을 달성했다. 블록 내부에서 미사용 위치는 <null>로 패딩해 다양한 박스 형식과 포인트 출력에 유연하게 대응하도록 설계되었다.
- 네트워크는 MoonViT 비전 인코더와 Qwen2.5-3B-Instruct 언어 모델을 결합한 native-resolution VLM 구성이다. MoonViT는 원본 해상도를 보존해 고해상도 시각 특징을 유지하고 Qwen2.5-3B-Instruct는 복합 질의에 대한 언어적 추론을 담당해 공간-언어 결합 능력을 강화했다. 둘 사이에는 MLP 기반의 멀티모달 프로젝터가 삽입되어 비전 임베딩을 언어 토큰 공간으로 정렬했다.
- 생성 모드로 Fast, Slow, Hybrid 세 방식을 제공해 용도별 성능-속도 트레이드오프를 제어한다. Fast 모드는 MTP만 사용해 최대 처리량을 노리며 단순 장면에서 우수한 성능을 보이고, Slow 모드는 전통적 autoregressive 디코딩을 사용해 포맷 불확실성이나 공간 애매성에서 더 안정적인 출력을 제공한다. Hybrid 모드는 MTP 우선 후 불확실 구간에서 AR 폴백을 수행하므로 대부분의 실제 워크로드에서 균형 잡힌 성능을 보였다.
- 배치 하이브리드 추론을 위해 la_flash 같은 FlashAttention-varlen 희소 범위 실행기와 kernel_utils를 도입해 메모리 피크를 감소시켰다. la_flash는 밀집 SDPA 마스크를 피하고 희소 범위 플랜으로 연산을 재편성해 A100 환경에서 메모리 사용량을 크게 낮췄다. 이 옵션적 런타임을 사용하면 동일한 고해상도 이미지에 대해 처리량을 높이면서도 메모리 요구량을 줄일 수 있다.
- 학습 데이터 파이프라인은 인간 어노테이션, 공개 데이터, 모델 보조 합성을 혼합해 대규모 라벨을 생성했다. 합성 라벨링에는 Qwen3-VL, Molmo, SAM 3, Rex-Omni 같은 모델이 참여했고 자동 후검증 절차를 포함해 라벨 품질을 확보했다. 이러한 혼성 라벨 전략은 희귀 객체와 전문 도메인을 포함한 광범위한 분포에서 모델이 일반화하도록 돕는다.
차별점
- 박스 좌표를 병렬 블록으로 예측하는 Parallel Box Decoding을 기본 설계로 채택해 기존의 토큰별 autoregressive 좌표 생성 방식과 처리 파이프라인을 근본적으로 차별화했다.
- 네이티브 해상도 입력을 유지하는 MoonViT 기반의 비전 인코더와 Qwen2.5-3B-Instruct 언어 백본을 결합해 고해상도 레이아웃, GUI 및 OCR과 같은 전문 도메인에서의 위치화 성능을 염두에 두고 설계되었다.
- 배치 하이브리드 디코딩과 la_flash/MagiAttention 같은 선택적 가속기를 통해 대규모 배치 추론과 메모리 최적화를 함께 고려한 실무적 런타임 구성이 포함되어 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| LVIS | F1@IoU mean | 50.7 | — |
| COCO | F1@IoU mean | 54.7 | — |
| Dense200 | F1@IoU mean | 58.7 | — |
| VisDrone | F1@IoU mean | 39.9 | — |
| ScreenSpot-Pro | Avg (text/icon tasks) | 60.3 | — |
| Throughput | Boxes per second (H100, batch=1) | 12.7 | 처음 표 기준 동일 실험군 대비 높은 처리량 |
이미지 분석




2.7k
Likes
1.5M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.