왜 중요한가
비전-언어 모델은 중간 사고의 언어 표현은 제시하되 이미지 증거와의 연결이 불완전한 경우가 많다. Visually grounded thinking은 중간 사고를 텍스트와 시각적 근거(객체의 위치나 경계)에 동시에 연결해 검증 가능성과 superviseability를 높이고, Counting 및 공간 추론 벤치에서 성능 향상을 보인다.
핵심 기여
데이터 합성 파이프라인
SAM3 기반 grounding agent를 중심으로 reasoning traces를 추출하고 시각 객체를 마스크(RLE)로 표현한다. 박스 모드와 포인트 모드 두 가지 형식의 정답 근거를 위한 SFT와 RL 학습 데이터를 생성한다.
grounding 보상 도입
grounding reward를 도입해 모델의 intermediate grounding이 올바른 이미지 증거에 매핑되도록 지도한다. 박스 모드와 포인트 모드 각각에 대해 IoU 기반 박스 점수, 마스크 내부 포인트의 F1 점수로 평가한다.
실험적 성과 및 비교
Counting 벤치(TallyQA, PixMo-Count 계열)와 공간 추론 벤치(VSR-zeroshot, EmbSpatial, SpatialMQA, MultihopSpatial)에서 베이스라인 대비 향상을 확인. 4B 모델이 Gemma3-27B-IT과 유의미하게 비슷하거나 우수한 성능을 보이며, 박스 기반 grounding의 경우 공간 태스크에서 더 큰 이득을 준다.
분석 및 비교
Counting은 주로 object 인스턴스 수준의 포인트 grounding이 효과적이며, 공간 관계 추론은 박스 grounding이 더 유용할 수 있다. 두 인터페이스의 강점이 다름에 따라 용도에 맞춘 grounding 방식 선택을 제시한다.
핵심 아이디어 이해하기
출발점: 비전-언어 모델은 시각적 증거를 텍스트로만 설명하기 쉽고, 실제 근거가 어떤 이미지 영역에 해당하는지 불분명하다. 기존 접근은 언어 중심의 Thinking을 제시하지만, 증거 영역이 불명확해 검증이 어렵다. 해결 원리: Thinking 과정에 태그로 좌표 기반의 grounding을 삽입해 각 사고 단계가 참조하는 시각 객체를 명시적으로 연결한다. Grounding은 point 또는 bounding box로 표현되며, SAM3 기반 grounding agent가 이미지에서 정확한 객체를 추출하고 RLE 마스크로 제시한다. RL 학습에서는 grounding rewards를 통해 답의 정확성과 증거 매칭의 정확성을 동시에 최적화한다. 달라지는 점: counting에서 포인트 grounding이 인스턴스 단위로 식별하기에 적합하고, 공간 추론에서는 박스 grounding이 객체의 경계와 크기가 유용한 정보를 제공한다. 4B 계열 모델은 동일 가족의 27B 모델과 비교해 종종 비슷하거나 더 나은 성능을 보인다.
관련 Figure

이미지-언어 사고의 기본 개념과 시각 증거 연결의 필요성을 시각적으로 요약한다. anchor_key는 core_intuition에 해당.
논문 1번 그림: Thinking in pure natural language 패널과 로봇 아이콘이 포함된 중간 사고 표현 구조
방법론
패러다임: SFT로 시작해 grounding이 포함된 thinking traces를 학습하고, RL(GRPO)로 모델이 생각하는 각 단계의 grounding 정확성을 보강한다. 입력: 이미지-질문-정답, 출력: 생각 텍스트 + grounding 태그. 패턴: [입력] → [thinking traces 생성] → [grounding 태그 삽입] → [RL 보상으로 학습] → [정답 및 grounding 정확도 최적화]. 핵심 메커니즘: SAM3 grounding agent를 이용해 객체를 식별하고, 각 객체에 대해 box 모드(좌상단–우하단 좌표) 또는 point 모드(객체 내부 한 점)로 좌표화한다. grounding 데이터는 두 버전의 SFT용 데이터와 RL용 데이터로 사용된다. 학습 세부: Gemma3-4B-IT 기반으로 SFT(6 에폭, 256 배치)와 RL(GRPO) 설정으로 학습한다. 데이터 합성 파이프라인은 19,909 reasoning traces, 107,613 grounding annotations를 생성한다.
관련 Figure

box-mode와 point-mode grounding의 차이와 각 모드의 적용 영역을 시각적으로 보강한다. anchor_key는 methodology / core_intuition.
box/point grounding의 Thinking 예시를 보여주는 그림

데이터 합성 파이프라인의 흐름(SFT/RL 데이터, grounding masks 등)과 SAM3 기반 grounding의 연결을 설명한다. anchor_key: methodology
데이터 합성 파이프라인 다이어그램
주요 결과
주요 벤치마크에서 베이스라인 대비 향상. Counting 벤치에서 Box-grounding의 경우 Acc/Pass@4가 크게 증가하고 Point-grounding도 유의미한 상승을 보임. Spatial 벤치에서 Box-grounding은 VSR-zeroshot, EmbSpatial에서 가장 높고, Point-grounding은 Counting에서 강한 성능을 발휘한다. Gemma3-4B-IT 대비 4B 모델이 Gemma3-27B-IT와 유사하거나 우수한 경우 다수. 박스-grounding은 공간 태스크에서 특히 이점이 크며, 포인트-grounding은 인스턴스 수준의 식별에 더 적합한 경향이 있음.
관련 Figure

벤치마크 별 소스 데이터 분포를 제시하며, 실험 범위의 다양성과 데이터 분포를 시각화한다. anchor_key: results
Source Dataset Distribution 도넛 차트
기술 상세
아키텍처: Gemma3-4B-IT를 기반으로 SFT 및 RL 학습 수행. Grounding agent(SAM3 기반)가 객체를 인식하고, RLE 마스크로 Box 및 Point 좌표를 추출한다. 두 모드의 좌표는 각각 ... 태그에 매핑되어 학습 데이터에 삽입되며, 좌표는 annotation 모델에 노출되지 않도록 placeholder 태그를 채운 뒤 좌표를 교정한다. Grounding 라우터를 통해 모델 생성 grounding 객체를 ground-truth grounding 객체와 매칭하고 IoU 또는 F1 점수로 질 평가를 수행한다. 보상 구성은 두 가지 형식 보상(R_ground + R_ans 등)과 응답 길이 제약 등의 sparse 보상을 합성한다. 학습 설정은 verl 기반으로 진행되며, 초기 SFT는 synthetic 데이터로 cold-start를 형성하고, 이후 RL로 grounding 품질과 정답 정확성을 함께 최적화한다. 평가 구성은 4번의 추론 패스에서 평균 정확도와 pass@4를 보고한다.
관련 Figure

grounding 대상 객체의 예시와 context를 보여주며, grounding의 필요성과 객체 식별의 정당성을 설명한다. anchor_key: technical_details
Ground-truth visual objects 예시 화면
한계점
포인트 grounding의 보상이 현재 실험에서 일관된 정확도 상승으로 이어지지 않는 경향이 있으며, 포인트 보상의 최적화 신호가 박스 보상에 비해 약할 수 있다. 또한 데이터 합성 파이프라인과 RL 학습의 비용(약 400 GPU-hours 수준)이 실무 적용 시 고려해야 한다.
실무 활용
시각 증거에 기반한 중간 사고를 학습 데이터로 제공합니다. grounding-aware RL으로 이미지-증거의 정합성을 강화하고, VLM의 해석 가능성과 재현성을 높이는 데 활용될 수 있습니다.
- Visual Question Answering에서 사고 과정을 시각적 근거와 함께 제시
- Counting 및 공간 관계 추론이 필요한 멀티모달 QA 시스템 고도화
- 교육용 도구에서 단계별 추론 검증 및 시각 증거 제시
- 로봇 비전 시스템에서 객체 인식과 공간 관계 추론의 신뢰성 향상
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- <obj> 태그(<obj> tag)
- — 중간 사고에서 참조하는 시각적 객체를 지칭하는 태그. box-mode 또는 point-mode로 좌표를 함께 포함하며, thinking 과정에서 시각 증거를 명시적으로 연결하는 수단이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.