nvidia/LocateAnything-3B
LocateAnything-3B는 Qwen2.5-3B-Instruct 기반의 3B 파라미터 비전-언어 모델로서 Parallel Box Decoding을 통해 박스 좌표를 병렬 예측하여 실시간급 그라운딩과 고밀도 검출 작업의 처리량을 개선한다.
학습 방식 · 기초 언어-비전 적응을 위한 캡셔닝·VQA·OCR 등 멀티모달 사전 적응 단계 이후에 그라운딩과 고밀도 장면 위치화로 세분화된 SFT(fine-tuning)를 수행했고, 합성 레이블과 모델 보조 라벨링을 혼합한 멀티도메인 데이터로 파인튜닝해 다양한 도메인에서 위치 추론 능력을 확보했다.
TL;DR
LocateAnything-3B는 Qwen2.5-3B-Instruct 언어 백본과 MoonViT 비전 인코더를 결합한 3B 파라미터의 비전-언어 모델로, 자연어 질의에 따라 박스와 포인트 형태의 위치 출력을 생성하도록 설계되었다. 핵심은 Parallel Box Decoding을 통해 좌표를 블록 단위로 병렬 예측함으로써 토큰별 autoregressive 과정을 줄이고 처리량을 향상시킨다는 점이며 README에서는 최대 약 2.5배의 처리량 이점을 보고했다. 학습은 약 12M 이미지와 138M 이상의 질의, 785M 바운딩박스를 포함한 대규모 멀티도메인 데이터로 이루어졌고 Fast/Slow/Hybrid 세 가지 생성 모드를 제공해 응용 요구에 따라 속도와 견고성 사이를 조절할 수 있다. 배포는 NVIDIA GPU 환경과 BF16/KV cache를 전제로 하며 TensorRT 등 일부 엔터프라이즈 런타임은 아직 공식 지원에서 제외되어 실제 도입 전 추가 검증과 런타임 최적화가 필요하다.
핵심 포인트
- 박스 좌표를 병렬 블록으로 예측하는 Parallel Box Decoding을 기본 설계로 채택해 기존의 토큰별 autoregressive 좌표 생성 방식과 처리 파이프라인을 근본적으로 차별화했다.
- 네이티브 해상도 입력을 유지하는 MoonViT 기반의 비전 인코더와 Qwen2.5-3B-Instruct 언어 백본을 결합해 고해상도 레이아웃, GUI 및 OCR과 같은 전문 도메인에서의 위치화 성능을 염두에 두고 설계되었다.
- 배치 하이브리드 디코딩과 la_flash/MagiAttention 같은 선택적 가속기를 통해 대규모 배치 추론과 메모리 최적화를 함께 고려한 실무적 런타임 구성이 포함되어 있다.
- Parallel Box Decoding을 통해 박스 좌표를 블록 단위로 병렬 예측함으로써 토큰별 순차 디코딩 비용을 줄였고, 원문 기준으로 이전 방식보다 최대 약 2.5배 높은 처리량을 보고했다. 이 설계는 고해상도 입력과 다수 객체가 존재하는 장면에서 실질적인 BPS(boxes per second) 향상을 가능하게 했다. 병렬 예측은 박스 간의 기하학적 일관성을 유지하도록 블록 구조와 포맷 패딩을 도입해 품질 저하를 제한했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| LVIS | F1@IoU mean | 50.7 | — |
| COCO | F1@IoU mean | 54.7 | — |
| Dense200 | F1@IoU mean | 58.7 | — |
| VisDrone | F1@IoU mean | 39.9 | — |
| ScreenSpot-Pro | Avg (text/icon tasks) | 60.3 | — |
| Throughput | Boxes per second (H100, batch=1) | 12.7 | 처음 표 기준 동일 실험군 대비 높은 처리량 |
이미지 분석




2.7k
LIKES
1.5M
DOWNLOADS
21 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.