TL;DR
초고해상도 장면에서 목표 객체가 이미지의 극히 작은 일부에만 포함되는 상황에서는 위치 찾기 자체가 주요 병목이다. PixelEyes는 추론과 정밀 지각을 분리해 마스크 수준의 근거를 도구로 획득하고, 의미영역 기반 너비우선탐색으로 불필요한 재크롭을 줄여 상호작용 효율을 높였다. 이 접근은 위치 검출과 답변 생성의 실패를 분리해 'inattentional blindness'를 정량적으로 줄이는 평가 지표를 가능하게 했다.
왜 중요한가
초고해상도 장면에서 목표 객체가 이미지의 극히 작은 일부에만 포함되는 상황에서는 위치 찾기 자체가 주요 병목이다. PixelEyes는 추론과 정밀 지각을 분리해 마스크 수준의 근거를 도구로 획득하고, 의미영역 기반 너비우선탐색으로 불필요한 재크롭을 줄여 상호작용 효율을 높였다. 이 접근은 위치 검출과 답변 생성의 실패를 분리해 'inattentional blindness'를 정량적으로 줄이는 평가 지표를 가능하게 했다.
핵심 기여
지각과 추론의 명시적 분리
PixelEyes는 일반 목적의 VLM을 플래너로 유지하고 정밀한 위치 검출은 외부 referring segmentation 도구(SAMTok)에 위임해 두 역할을 분리했다. 이 분리는 모델이 부정확한 그라운딩을 스스로 보상하느라 긴 경로를 만들지 않도록 하고, 각 모듈이 자체 목적에 최적화된 기능을 발휘하게 했다. 분리 설계는 복잡한 장면에서의 반복적 크롭을 현저히 감소시켰다.
마스크 기반 시각 탐색과 스위처블 도구
마스크 기반 크롭은 후보 박스와 자연어 참조표현을 결합해 SAMTok으로 픽셀 마스크를 얻고 이를 타겟 중심으로 확장해 반환하는 파이프라인이다. 이와 함께 인스턴스 분할이 부적합한 경우를 위해 바운딩박스 기반 크롭으로 자동 전환하는 스위처블 도구를 도입해 도메인 다양성을 확보했다. 실험에서 두 모드 병용이 실제 벤치마크 성능을 개선했다.
Semantic-Region BFS로 탐색 구조 학습
에이전트는 각 턴에서 간단한 지역 캡션을 생성하고 전체 이미지 좌표계에서 낮은 IoU를 유지하는 새로운 후보 박스를 제안해 의미 단위의 너비우선탐색을 수행했다. 이 전략은 깊이우선의 재귀적 반사·검증 필요성을 제거해 루프에 빠지는 위험을 줄였고, 탐색 커버리지를 우선 확보해 턴당 효용을 높였다. SFT와 RL 학습에서 이 구조적 행동을 내재화한 것이 성능 향상으로 이어졌다.
고품질 다중턴 경로 합성 및 평가 데이터셋
기존 Mini-o3의 원본 이미지-질문 쌍을 도구 확장 롤아웃으로 재합성해 PixelEyes-6K라는 5.8K 전문가 경로 집합을 구성했다. 이 데이터는 성공적으로 정답에 도달한 경로만 보존해 구조적 탐색 논리를 SFT 대상에 직접 주입했다. 또한 zero-hint 프로토콜과 마스크/바운딩박스 어노테이션을 포함한 Pinpoint-Bench(433샘플)를 만들어 로컬라이제이션 실패와 추론 실패를 분리하는 진단 지표를 제공했다.
핵심 아이디어 이해하기
문제의 출발점은 다중턴 시각 추론 에이전트가 '무엇을 볼지(decide what to look for)'와 '어디에 있는지(grounding)'를 동일한 모델에 맡길 때 발생하는 상호 간섭이다. 일반 목적 VLM은 텍스트-이미지 추론에 강하지만 픽셀 수준의 정밀한 로컬라이제이션에서는 전문 분할기보다 약하므로, 동일 모델이 두 역할을 동시에 수행하면 부정확한 그라운딩이 추가 추론 턴을 유발해 경로가 길어지는 현상이 빈번하게 나타났다. 이 현상이 바로 논문이 'inattentional blindness'로 규정한, 대상은 방문했지만 인식해 답변으로 연결하지 못하는 실패 유형이다.
핵심 해결 원리는 역할 분리와 탐색 구조의 명시적 설계에 있다. 모델은 고수준의 공간 계획과 참조 표현 생성을 담당하고, 참조 표현과 후보 박스를 외부의 referring segmentation 도구에 전달해 픽셀 마스크를 받아온다. 마스크가 존재하면 해당 마스크의 tight bbox를 확대해 타겟 중심 크롭을 생성하고 이를 다음 추론 단계의 관찰로 추가한다. 도식적으로 보면, '계획(텍스트 사고) → 후보 박스 제안 → 도구 호출(마스크 획득) → 타겟 크롭 반환'의 루프가 반복되며 각 모듈은 자신의 전문 역할만 수행한다.
Semantic-Region BFS는 기존의 깊이우선 기반 검증 루프를 대체해 반복적 재크롭을 방지하는 작동원리다. 이전 탐색의 실패(마스크 부재)는 그 지역이 타겟을 포함하지 않을 가능성이 높다는 강한 사전 확률로 해석되어 형제 지역으로 수평 탐색을 우선한다. 이로 인해 전체 커버리지가 빠르게 확보되고, 도구 기반 마스크가 제공하는 고밀도 증거 입력은 후속 추론의 신뢰도를 높여 최종 정답 도달률과 턴 효율을 동시에 개선한다.
방법론
전체 접근은 VLM 정책 πθ가 텍스트 사고(Thought)와 행동(Action)을 생성하는 다중턴 의사결정 루프 형태로 정의된다. 각 턴에서 모델은 축적된 콘텍스트를 평가해 추가 관찰이 필요한지를 판단하고, 필요하면 지역 캡션(c_t)을 생성해 의미적 계획을 세운 뒤 전역 좌표계에 속하는 낮은 IoU 후보 박스(B_t^{in})를 제안한다. 제안된 박스와 참조 표현(ℰ_t)은 마스크 기반 크롭 도구로 전달되어 SAMTok이 픽셀 마스크 M_t를 반환하면 tight 마스크 박스를 스케일링해 최종 관찰 O_t를 생성한다.
마스크 기반 파이프라인이 실패(M_t = ∅)하면 시스템은 즉시 후보 박스 그대로를 출력하고 다음 턴에서는 다른 의미영역을 선택하도록 설계되어 있다. 이때 의미영역 이력 S_t는 { (B_i^{in}, c_i) } 형태로 원본 이미지 좌표에 고정되어 저장되며 이후 계획은 이 이력을 바탕으로 수평적 BFS를 수행한다. 도구 선택은 상황에 따라 자동 전환되며, 인스턴스 분할이 비적합한 경우에는 bbox_based_crop을 사용하도록 스위처블 로직이 적용된다.
학습 파이프라인은 두 단계다. 첫 단계는 PixelEyes-6K로 정의된 5.8K 성공 경로에 대해 감독 학습(SFT)을 수행해 정책이 의미영역 BFS, 도구 전환, 참조 표현 추출을 모방하게 만든다. 두 번째 단계는 vanilla GRPO 기반의 강화학습으로 정밀한 탐색 경로를 추가로 최적화하며, 이때 SFT 모델로 사전 필터링해 훈련 데이터의 품질을 유지한다. 데이터 합성은 Gemini 계열의 교사 롤아웃을 도구 호출 규약과 의미영역 예약 규칙으로 제어해 높은 충실도의 다중턴 궤적을 생성했다.
관련 Figure

이 피처 이미지는 결합형 에이전트가 고정된 bbox 탐색에서 반복적 루프와 inattentional blindness를 겪는 사례와 PixelEyes가 SAMTok 마스크와 Semantic-Region BFS로 동일한 인스턴스를 적은 턴에 찾는 과정을 나란히 배치해 차이를 드러낸다. 오른쪽에는 벤치마크 성능 막대그래프가 있어 PixelEyes가 다양한 데이터셋에서 우수한 정확도와 효율을 달성했다는 실험적 근거를 시각적으로 보강한다. 따라서 이 그림은 방법의 동기와 주요 정량 성과를 동시에 연결하는 역할을 한다.
논문 요지와 비교 사례를 한 장의 그림으로 보여주며 결합형 에이전트의 반복적 크롭 문제와 PixelEyes의 마스크 기반 탐색 및 성능 향상을 병행해 제시한다.

이 다이어그램은 정책이 텍스트 사고를 통해 지역 캡션과 후보 박스를 생성하고, 이를 도구 인자로 넘겨 SAMTok이 픽셀 마스크를 반환하는 순차적 절차를 명확히 보여준다. 파이프라인은 전역 좌표계에 기반한 후보 제안과 마스크 기반의 tight crop 생성, 그리고 관찰을 콘텍스트에 추가하는 루프를 시각적으로 정리하고 있어 방법론의 각 구성 요소가 어떻게 결합되는지 이해하는 데 직접적인 도움이 된다. 따라서 이 그림은 방법의 운영적 세부와 도구 호출 인터페이스의 핵심을 보강한다.
에이전트 파이프라인 다이어그램으로 입력 이미지, 정책의 다중 체인-오브-생각 생성, mask_based_crop 호출과 SAMTok의 마스크 반환 및 크롭의 흐름을 도식화했다.

이 그림은 전문가 궤적 합성 방식의 단계적 흐름을 제시해 데이터 품질 확보가 방법 성능에 어떻게 기여했는지를 직관적으로 연결한다. 특히 도구 정의, In-Context 시범, 클로즈드-루프 롤아웃, 경로 필터링의 순서를 도식화해 왜 7K 원시에서 5.8K의 고충실 경로가 추출되었는지와 그 경로가 SFT의 핵심 학습 자산이 되었음을 보여준다. 결과적으로 이 그림은 학습 데이터 구성과 성능 향상의 인과 관계를 보강하는 시각적 근거로 작동한다.
데이터 파이프라인을 보여주는 도식으로 Mini-o3 원시 쌍에서 도구 보강 롤아웃을 거쳐 PixelEyes-6K를 합성하고, SFT와 RL을 거쳐 최종 출력과 고품질 데이터셋을 생성하는 과정을 나타낸다.
주요 결과
PixelEyes는 다양한 고해상도 및 어려운 시각 탐색 벤치마크에서 기준 모델과 기존 활발한 연구군을 상회하는 성능을 보였다. 예컨대 PixelEyes-8B는 V*에서 94.24% 정확도를 기록했고 HR-Bench-4K/8K와 VisualProbe에서도 일관되게 우수한 수치를 보였다. 논문은 PixelEyes-4B와 8B가 Qwen-3-VL의 동일 규모 기반보다 다수 지표에서 유의미한 개선을 달성했다고 제시했다.
Pinpoint-Bench의 진단적 분석에서는 Localization Success Rate(LSR)와 Turn-to-Answer Efficiency(TAE)를 병행해 평가했으며, PixelEyes는 LSR과 정확도의 격차를 줄이면서 TAE를 크게 향상시켰다. 예를 들어 Mini-o3는 높은 LSR을 보였으나 최종 정확도가 낮아 LSR-Acc 격차가 컸고, PixelEyes는 마스크 기반 크롭으로 이 간극을 줄여 정확도와 효율 둘 다 개선했다. 전체적으로 SFT 데이터의 구조적 품질(PixelEyes-6K)과 GRPO 기반 RL 결합이 성능 향상에 핵심적 역할을 수행했다.
추가적인 성분분석(ablation)에서 마스크 기반 탐색과 Semantic-Region BFS의 결합이 성능에 결정적 영향을 미쳤고, SAMTok 같은 강건한 마스크 그라운더가 대체 불가능한 구성 요소로 작용했다. Sa2VA로 교체하면 정확도·TAE·LSR이 모두 하락했고 SAMTok은 높은 도구 호출 성공률(ISR=99.17%)을 기록해 실험적 근거를 제공했다. 따라서 마스크 그라운더의 성능이 전체 파이프라인의 병목이 될 수 있음이 실험으로 확인되었다.
기술 상세
전체 아키텍처는 정책 VLM(글로벌 플래너)과 외부 referring segmentation 도구(SAMTok)를 도구 호출 인터페이스로 연결한 모듈화 구조다. 정책은 텍스트 사고와 행동 액션을 토큰 단위로 생성하며, 행동은 mask_based_crop, bbox_based_crop, answer 중 하나로 구성된다. mask_based_crop의 내부는 후보 박스 제안 → 로컬 패치 추출 → SAMTok에 패치와 참조 표현 입력 → 마스크 반환 → tight bbox 산출 및 스케일링으로 이루어진다.
Semantic-Region BFS는 시간에 따라 누적되는 의미 이력 S_t를 유지하며, 각 엔트리는 전역좌표 기준의 B^{in}_i와 간단한 지역 캡션 c_i로 구성된다. 정책은 이 이력을 바탕으로 새로운 지역을 계획하고 낮은 IoU 제약을 적용해 전역 커버리지를 확장한다. 이로 인해 복수 수준의 로컬 좌표계를 관리할 필요가 사라지고, 반사(backtracking)로 인한 공간적 혼동이 제거된다.
학습 세부사항은 두 단계로 구성되며, SFT 단계에서는 PixelEyes-6K의 성공 경로로 정책을 초기화해 의미 캡션 생성, 낮은 IoU 박스 제안, 도구 선택과 같은 행동 분포를 학습시켰다. 이후 RL 단계에서는 vanilla GRPO를 적용해 경로 효율성을 추가로 최적화했으며, RL 데이터는 SFT 모델로 필터링해 해결률이 낮거나 지나치게 쉬운 샘플을 제거했다. 논문은 over-turn masking을 사용하지 않고 vanilla GRPO를 사용해 간결한 탐색을 장려했다고 보고했다.
한계점
PixelEyes의 성능은 외부 마스크 그라운더의 강건성에 크게 의존한다는 점이 실험적으로 확인되었다. Sa2VA 같은 대체 백엔드로 바꾸면 정확도와 LSR이 유의하게 하락해 그라운더의 품질이 전체 시스템의 병목이 될 수 있다. 또한 zero-hint 프로토콜과 극히 작은 목표 비율(평균 ROI 면적 0.07%) 때문에 일부 장면과 질의 유형에서는 여전히 높은 실패율과 언어적 애매성이 남아 있다.
실무 활용
PixelEyes의 구조적 분리는 실제 시각 검색 시스템에서 탐색 효율과 정밀도를 동시에 개선하는 현실적 근거를 제공한다. 특히 초고해상도 이미지에서 작은 목표를 찾아야 하는 산업적 응용, 예컨대 원격 감시나 품질 검사, 복잡한 장면의 세부 속성 판정에 적용 가능성이 높다. 공개된 코드·저장소가 있어 연구 재현과 현장 적용을 위한 기반이 마련되어 있다.
- 초고해상도 항공·위성 영상에서 미세 객체를 자동으로 탐지해 속성 식별을 수행하는 정밀 감시 워크플로
- 제품 불량 검사에서 작은 결함 부위를 찾아 색상·문구 등 속성 OCR을 수행하는 자동화된 시각 검사 파이프라인
- 복잡한 상업 사진에서 특정 로고·라벨·작은 텍스트를 찾고 속성 판단을 수행하는 데이터 라벨링 보조 도구
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Mask-guided Visual Search
- — 마스크 기반 시각 탐색은 후보 박스와 자연어 참조표현을 결합해 referring segmentation 모델로 픽셀 단위 마스크를 획득하고 이를 타겟 중심 크롭으로 확장해 다음 단계의 증거로 사용하는 기법이다. 이 과정은 박스 수준의 잡음을 제거해 후속 추론 입력을 고밀도로 집중시키며 작은 객체의 위치 검출 실패로 인한 반복적 탐색을 줄인다. PixelEyes는 이 기법을 도구 호출(tool-call) 형태로 분리해 일반적 추론기와 별도 작동시킨다.
- Semantic-Region BFS
- — Semantic-Region BFS는 탐색 기록을 원본 이미지 좌표계에 고정된 의미 캡션과 박스 목록으로 관리하고, 실패한 지역을 수평적으로 확장해 형제 영역을 우선 검사하는 전략이다. 이 방식은 깊이 우선의 재귀적 세부확인으로 인한 재탐색 루프와 소스 참조 문제를 피하고, 전체 커버리지를 우선 확보해 급격한 탐색 비효율을 줄인다. PixelEyes는 이 전략을 통해 불필요한 재크롭을 줄이고 상호작용(turn) 수를 단축했다.
- Referring Segmentation
- — Referring Segmentation은 자연어로 주어진 참조 표현을 입력으로 받아 해당 대상의 픽셀 단위 마스크를 반환하는 시각 모델 계열이다. 이 기법은 작은 객체나 복잡한 배경에서 경계가 정확한 위치 증거를 제공하므로 텍스트-비전 작업에서 정밀한 근거 추출이 가능하다. PixelEyes는 SAMTok 같은 referring segmentation을 외부 도구로 호출해 추론 모델과 분리해 사용했다.
- Switchable Tool Use
- — Switchable Tool Use는 인스턴스 수준 분할이 부적절한 경우(예: 도표, 지도, 조밀한 텍스트)에는 바운딩박스 크롭을 자동으로 선택해 마스크 기반 접근과 바운딩박스 기반 접근을 상황에 맞게 전환하는 정책이다. 이 설계는 마스크가 언제나 최선이 아니라는 전제를 반영해 다양한 입력 유형에 대해 안정된 결과를 보장한다. PixelEyes는 이 메커니즘을 통해 범용성과 정밀성 사이의 균형을 유지했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.