왜 중요한가
비전-언어 모델에서 좌표를 순차적으로 생성하는 기존 방식은 박스 기하 구조의 제약을 포착하기 힘들고 추론 지연이 크다. LocateAnything은 bounding box를 atomic unit으로 간주하는 Parallel Box Decoding(PBD)을 도입해 박스 간 기하적 일관성을 유지하면서 병렬 디코딩의 속도를 대폭 끌어올린다. 또한 LocateAnything-Data를 통해 138M 질의의 대규모 다-domain 학습 데이터를 확보해 고정밀 로컬라이제이션 성능을 크게 강화한다.
핵심 기여
Box-aligned Parallel Box Decoding(PBD) 도입
bbox 좌표를 하나의 atomic block으로 처리해 2D 공간 정보를 일관되게 보존하며 토큰 단위의 순차 디코딩 대신 병렬 디코딩의 이점을 누릴 수 있게 한다. 이를 통해 처리량과 위치 정확도 간의 균형을 달성한다.
Hybrid decoding 정책
병렬 출력의 형식 불일치나 공간 애매함을 탐지하면 해당 블록에 대해 NTP 재디코딩을 수행하고, 이후 다시 MTP로 전환하여 속도와 안정성을 동시에 유지한다.
LocateAnything-Data 대규모 데이터세트
12M 이미지와 138M 질의, 785M 바운딩 박스를 포함하는 다-domain 데이터로 학습 신호를 확장하고 다양한 grounding/detection 태스크에 대한 일반화 능력을 강화한다.
On-demand decoding 모드
Fast Mode(MTP), Slow Mode(NTP), Hybrid Mode를 제공하여 실시간 애플리케이션에 적합한 속도-정확도 트레이드를 유연하게 조정한다.
Dual-formulation training & 이질적 마스크
입력 시퀀스를 두 형식(NTP 토큰 스트림, MTP 블록 스트림)으로 함께 학습시키고, MagiAttention으로 다양한 마스크를 효율적으로 처리한다.
핵심 아이디어 이해하기
출발점: 좌표를 1D 토큰으로 직렬화하는 기존 접근은 2D 박스의 기하적 연속성을 활용하지 못하고 학습과 추론에서 불일치가 발생한다. 해결 원리: bounding box를 하나의 atomic block으로 간주하고, NTP와 MTP를 박스 단위로 함께 학습시키되, 블록 단위로 인코딩된 출력이 박스의 기하학적 연속성을 보장하도록 한다. 세부적으로, x_vis/x_q를 공유 컨텍스트로 두고, x_ntp(토큰 시퀀스)와 x_blk(박스 기반 시퀀스)를 결합해 두 포맷을 동시에 학습한다. 주의 메커니즘은 NTP에 대해 causal, MTP 블록 간에는 블록-크루스컬하고 intra-block는 양방향으로 설정한다. 그 결과, 박스 단위의 출력을 단일 forward pass로 생성하면서도 구조적 일관성과 학습 신호의 질을 유지한다. 실용적 의의는 병렬 디코딩으로 처리량을 크게 높이고, 혼합 모드로 복수 인스턴스에서도 안정적인 로컬라이제이션을 제공한다.
관련 Figure

다목적 localization 태스크를 하나의 비전-언어 백본으로 처리하는 아이디어를 시각적으로 요약한다. 박스 단위 병렬 디코딩의 핵심 아이디어를 직관적으로 보여준다.
Figure 1: LocateAnything의 Versatile Tasks 및 Parallel Box Decoding의 개념 도식
방법론
전체 접근 방식: native-resolution 비전 인코더(Moon-ViT)와 언어 디코더(Qwen2.5)를 연결하고, 시각 특징 Z와 텍스트 질의 E를 이용해 B=(b1,...,bN)로 구성된 block 시퀀스를 예측한다. 각 블록 b_i는 길이 L=6으로 구성되며, 와 사이의 4개 좌표와 2개의 구조 토큰으로 구성된다. 4가지 블록 타입: Semantic, Box, Negative, End. 입력(target)으로부터 x_all = x_vis ⊕ x_q ⊕ x_ntp ⊕ x_blk를 구성해 두 형식의 ground-truth를 동일한 그래프에서 학습한다. 학습 시 두 손실을 합치는 방식으로 ℒ = ℒ_ntp + ℒ_mtp를 최소화한다. 어텐션 마스크: NTP 스트림은 causal, MTP는 블록-크 causal, intra-block는 bidirectional로 구성되며 KV 캐시의 일관성을 유지한다. 인퍼런스 시에는 Slow(Autoregressive NTP), Fast(MTP 박스 블록 예측), Hybrid(둘의 조합) 중 선택한다. 3.2 학습 설계: x_all의 구성은 시퀀스 길이에 따라 블록별로 [mask] 토큰으로 치환하여 전체 블록의 토큰을 한 번에 예측하도록 한다. 3.3 추론 설계: 포맷 불일치/공간 애매함 탐지 시 현재 블록의 출력을 NTP로 재디코딩하고 이후 다시 MTP로 복귀하는 정책을 도입한다. 3.4 LocateAnything-Data 구성: Detection, GUI, Referring, OCR, Layout, Pointing 등 6개 도메인으로 구성된 12M 이미지, 138M 질의, 785M 바운딩 박스 등의 데이터를 합성/수집한다. 4.1 학습 단계 구성: Stage1/Stage2에서 world-knowledge injection, Stage3(Detection & Grounding), Stage4(Dense Detection Enhancement)으로 이어지는 4단계 학습 플로우를 제시한다. 3.1 아키텍처 상의 4개 블록 타입은 Semantic/Box/Negative/End로 정의된다. 3.2의 듀얼 포맷 입력은 NTP 스트림의 causal attention과 MTP 스트림의 block-causal, intra-block의 bidirectional attention으로 구성된다.
관련 Figure

블록 기반 출력 표현과 4가지 블록 타입(Semantic/Box/Negative/End)을 통해 박스 단위 출력을 정의하는 방식을 시각화한다.
Figure 3: Architecture and Block-Based Output Representation

형식 불일치나 공간 애매함이 발생한 경우 NTP 재디코딩으로 보정하는 절차를 시각화한다.
Figure 5: Corrected NTP Re-decoding
주요 결과
주요 벤치마크에서 LocateAnything-3B는 LVIS에서 mean F1 +3.8%, COCO에서 +1.8%를 달성했고, Dense200에서 39.9의 mean F1, VisDrone에서 39.9를 기록했다. GUI Grounding에서 ScreenSpot-Pro 대비 평균 60.3으로 SOTA에 근접했다. DocLayNet 91.1/35.8/76.8, M6Doc 90.6/25.8/70.1, TotalText 58.9/5.1/43.3의 문서 레이아웃/ OCR 태스크 성능을 보였다. Referring 표현(recognition) 벤치마크에서 LocateAnything-3B는 HumanRef 82.9/68.8/78.7, RefCOCOg val 88.6/41.5/76.7, RefCOCOg test 88.8/43.4/77.6으로 Rex-Omni-3B 및 Qwen3-VL 대비 우수한 결과를 보였다. 추론 속도 측면에서 Hybrid Mode에서 12.7 BPS, Fast Mode에서 15.3 BPS, Slow Mode에서 4.3 BPS로 운영되며 속도-정확도 트레이드오프를 제시한다. backbone 일반화에서도 Qwen3-VL-4B에 PBD를 적용시 속도/정확도 향상을 보였다.
관련 Figure

박스 정렬 순서와 디코딩 속도에 관한 ablation 결과를 제시하며, 박스-단위 병렬 decoding의 성능 및 속도 차이를 보여준다.
Figure 7: Ablation Study on Box Ordering and Decoding Speed
기술 상세
아키텍처: Moon-ViT 기반 비전 인코더와 Qwen2.5 기반 언어 디코더를 연결하고, Z와 질의 E를 입력으로 받아 박스 기하 단위인 block 시퀀스 B를 생성한다. 출력 단위로 6 토큰 길이의 Box Block 4종류를 도입하고, Semantic/Box/Negative/End의 4가지 유형을 정의한다. 학습: x_vis/x_q를 공유 컨텍스트로 두고, x_ntp/x_blk 두 가지 포맷의 ground-truth를 하나의 x_all 시퀀스로 학습한다. 손실은 ℒ_ntp + ℒ_blk로 구성되며, Attention Masks은 NTP에 대한 causal, MTP에 대한 블록-크 causal and intra-block bidirectional로 구성한다. 추론 모드의 선택은 Fast/Hybrid/Slow의 상호 보완으로 구현되며, KV 캐시 관리는 재귀적 일관성을 유지한다. LocateAnything-Data는 Detection/GUI/Referring/OCR/Layout/Pointing/ Text 등 6개 도메인의 다양한 데이터를 포함하고, 데이터 엔진은 OpenImages, Objects365 및 Unlabeled 이미지에서 질의를 합성한다.
한계점
제시된 제한점으로는 현재 지도학습 위주 학습이며, 강화학습 기반의 블록 디코딩 정책 최적화나 worst-case 디코딩 속도 개선에 대한 후속 연구가 필요하다.
실무 활용
다양한 GUI grounding, 문서 이해, 텍스트 로컬라이제이션 등 실무 응용 가능성이 높다.
- GUI Grounding 기반의 대화형 에이전트
- 문서 레이아웃 분석 및 OCR
- 복잡한 장면에서의 Dense Object Detection
- 자연 이미지의 텍스트 로컬라이제이션
- 다중 목표 grounding이 필요한 복합 프롬프트
코드 공개 여부: 비공개
키워드
용어 해설
- 좌표 토큰 생성(Coordinate-Token Generation)
- — 좌표를 1D 토큰으로 직렬화하는 기존 방식의 한계를 보완하기 위해 좌표를 하나의 박스 단위(block)로 처리하여 박스 내부의 좌표 간 상관관계를 보존하고 학습 신호의 구조적 정합성을 강화하는 방법.
- 블록-인 주의(Block-Causal Attention)
- — 학습·추론 시 여러 블록으로 구성된 시퀀스에서 현재 블록이 이전 블록의 정보에만 접근하도록 하는 주의 패턴으로, 박스 간 의존성을 유지하면서도 병렬화를 가능하게 한다.
- KV 캐시(KV-Cache)
- — 추론 중 이전 토큰들의 Key-Value를 저장해 재사용함으로써 KV-캐시를 유지하며 계산 중복을 줄이고 일관된 Prefix를 보장한다.
- 스트림 패킹(Stream Packing)
- — 다양한 길이의 시퀀스를 동적으로 하나의 미니배치에 밀집하게 구성해 GPU 이용률을 높이고 학습 효율을 높이는 기법.
- MagiAttention
- — 이질적 마스크를 포함하는 초장 컨텍스트를 분산 학습에서 효율적으로 처리하기 위한 분산 어텐션 프레임워크.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
