본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/LocateAnything-3B

자연어 질의에 따른 다중 객체 검출, 지칭 표현 그라운딩, GUI 요소 위치화, 장면 텍스트 검출 및 포인팅을 포함한 이미지-텍스트 투 텍스트 기반 시각 위치화 작업을 수행한다.3B학습 시 최대 25,600 토큰, 프롬프트 지원 최대 24K 토큰, 추론 시 권장 max_new_tokens 8192 컨텍스트nvidia-license

LocateAnything-3B는 Qwen2.5-3B-Instruct 기반의 3B 파라미터 비전-언어 모델로서 Parallel Box Decoding을 통해 박스 좌표를 병렬 예측하여 실시간급 그라운딩과 고밀도 검출 작업의 처리량을 개선한다.

학습 방식 · 기초 언어-비전 적응을 위한 캡셔닝·VQA·OCR 등 멀티모달 사전 적응 단계 이후에 그라운딩과 고밀도 장면 위치화로 세분화된 SFT(fine-tuning)를 수행했고, 합성 레이블과 모델 보조 라벨링을 혼합한 멀티도메인 데이터로 파인튜닝해 다양한 도메인에서 위치 추론 능력을 확보했다.

TL;DR

LocateAnything-3B는 Qwen2.5-3B-Instruct 언어 백본과 MoonViT 비전 인코더를 결합한 3B 파라미터의 비전-언어 모델로, 자연어 질의에 따라 박스와 포인트 형태의 위치 출력을 생성하도록 설계되었다. 핵심은 Parallel Box Decoding을 통해 좌표를 블록 단위로 병렬 예측함으로써 토큰별 autoregressive 과정을 줄이고 처리량을 향상시킨다는 점이며 README에서는 최대 약 2.5배의 처리량 이점을 보고했다. 학습은 약 12M 이미지와 138M 이상의 질의, 785M 바운딩박스를 포함한 대규모 멀티도메인 데이터로 이루어졌고 Fast/Slow/Hybrid 세 가지 생성 모드를 제공해 응용 요구에 따라 속도와 견고성 사이를 조절할 수 있다. 배포는 NVIDIA GPU 환경과 BF16/KV cache를 전제로 하며 TensorRT 등 일부 엔터프라이즈 런타임은 아직 공식 지원에서 제외되어 실제 도입 전 추가 검증과 런타임 최적화가 필요하다.

핵심 포인트

  • 박스 좌표를 병렬 블록으로 예측하는 Parallel Box Decoding을 기본 설계로 채택해 기존의 토큰별 autoregressive 좌표 생성 방식과 처리 파이프라인을 근본적으로 차별화했다.
  • 네이티브 해상도 입력을 유지하는 MoonViT 기반의 비전 인코더와 Qwen2.5-3B-Instruct 언어 백본을 결합해 고해상도 레이아웃, GUI 및 OCR과 같은 전문 도메인에서의 위치화 성능을 염두에 두고 설계되었다.
  • 배치 하이브리드 디코딩과 la_flash/MagiAttention 같은 선택적 가속기를 통해 대규모 배치 추론과 메모리 최적화를 함께 고려한 실무적 런타임 구성이 포함되어 있다.
  • Parallel Box Decoding을 통해 박스 좌표를 블록 단위로 병렬 예측함으로써 토큰별 순차 디코딩 비용을 줄였고, 원문 기준으로 이전 방식보다 최대 약 2.5배 높은 처리량을 보고했다. 이 설계는 고해상도 입력과 다수 객체가 존재하는 장면에서 실질적인 BPS(boxes per second) 향상을 가능하게 했다. 병렬 예측은 박스 간의 기하학적 일관성을 유지하도록 블록 구조와 포맷 패딩을 도입해 품질 저하를 제한했다.

벤치마크

벤치마크지표비교
LVISF1@IoU mean50.7
COCOF1@IoU mean54.7
Dense200F1@IoU mean58.7
VisDroneF1@IoU mean39.9
ScreenSpot-ProAvg (text/icon tasks)60.3
ThroughputBoxes per second (H100, batch=1)12.7처음 표 기준 동일 실험군 대비 높은 처리량

이미지 분석

테저 이미지는 LocateAnything의 다중 태스크 적용 사례와 병렬 박스 디코딩 개념을 시각적으로 요약한 인포그래픽이다. 상단에는 다양한 그라운딩 태스크 예시가 배치되어 있고 하단에는 텍스트 기반 디코딩 패러다임의 진화를 도식화한 다이어그램이 포함되어 있다. 이 이미지는 모델이 지원하는 입력·출력 포맷과 병렬 박스 블록 디코딩의 처리 흐름을 직관적으로 제시한다.
이미지 도식은 Parallel Box Decoding의 핵심을 블록 기반 출력과 병렬 처리 스텝으로 표현하고 있으며 Fast/Hybrid/Slow 같은 모드 차이를 시각적으로 구분했다. 디코딩 예시에서 텍스트 기반 좌표 디코딩과 양자화 좌표 디코딩, 병렬 박스 디코딩의 스텝 수 차이를 보여주어 병렬화가 토큰 효율과 단계 감소로 이어짐을 전달한다. 이 도식은 모델의 설계 의도가 '토큰 효율성 향상'과 '병렬 추론'에 있음을 근거 문장으로 뒷받침한다.
이 차트는 LocateAnything-3B와 여러 비전-언어 및 전문 검출기들 간의 COCO와 LVIS 벤치마크 성능을 표 형태로 비교한 결과를 시각화한 표이다. 표에는 F1@IoU 0.5, 0.95 및 평균 수치가 포함되어 있어 높은 IoU에서의 정밀도와 낮은 IoU에서의 검출 능력을 동시에 보여준다. LocateAnything-3B의 행에는 LVIS 평균 50.7과 COCO 평균 54.7 등의 수치가 기재되어 있다.
표는 LocateAnything-3B가 LVIS와 COCO에서 경쟁력 있는 평균 F1 점수를 기록했음을 보여주며, 특히 다양한 모델군(전용 검출기, VLM 계열)과 직접 비교 가능한 형식을 제공한다. 수치 라벨링은 각 IoU 임계값에서의 성능 분포를 드러내므로 고정밀 검출 요구와 범용 검출 요구 사이의 트레이드오프를 평가할 수 있다. 이 표는 README의 정량적 주장과 일치하는 근거로 사용될 수 있다.
이 시각화는 Dense200 및 VisDrone와 같은 고밀도 또는 드론 이미지 데이터셋에서의 성능 표를 포함하고 있어 밀집 검출 작업에서의 모델 성능을 강조한다. 표에는 F1@IoU 0.5, 0.95 및 평균 점수가 나열되어 있고 LocateAnything-3B는 Dense200 평균 58.7, VisDrone 평균 39.9를 보고했다. 이미지는 모델이 밀집 장면에서의 위치화 성능과 IoU 민감도를 평가한 결과를 담고 있다.
Dense 및 드론 데이터셋 결과는 모델이 밀집 객체 환경에서 상당한 평균 F1을 달성했음을 시사하며, 특히 IoU 0.95에서의 수치로 고정밀 검출 성능을 가늠할 수 있다. 표의 구성은 다양한 데이터 분포에서의 일반화 역량을 비교할 수 있게 해 주며 LocateAnything의 네이티브 해상도 처리와 병렬 디코딩이 밀집 장면에서 처리량과 정확도에 기여했음을 뒷받침한다. 이 이미지는 모델의 도메인 범용성과 고밀도 장면 대응력을 근거로 제시한다.
이 차트는 ScreenSpot-Pro 벤치마크에서의 GUI 텍스트와 아이콘 태스크별 성능을 보여주며 LocateAnything-3B가 평균 60.3을 기록한 결과를 포함하고 있다. 열은 개발·크리에이티브·CAD·사이언스·오피스·OS 등 카테고리별 태스크를 구분해 다중 전문 GUI 환경에서의 강점을 드러낸다. 해당 이미지는 GUI 요소 그라운딩과 고해상도 화면 분석에 대한 성능 지표를 제공한다.
ScreenSpot-Pro 표는 GUI와 아이콘 감지에서의 세부 성능 분포를 보여주며, LocateAnything이 GUI 관련 태스크에서 실무적으로 활용 가능한 수준의 평균 점수를 기록했음을 확인할 수 있다. 카테고리별 편차는 특정 UI 스타일이나 해상도에 따라 성능이 달라질 수 있음을 시사하며, 이는 모델이 다양한 GUI 디자인과 해상도에 대해 추가적인 도메인 적응을 필요로 할 수 있음을 암시한다. 이 이미지는 README의 응용 사례 설명과 일치하는 실험 증거 역할을 한다.

2.7k

LIKES

1.5M

DOWNLOADS

21 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.