TL;DR
세부 시각 추론은 이미지의 작은 영역에서 증거를 찾아 문맥화해야 하는데, 기존 RL 기반 방법은 탐색 비용이 크고 SFT는 대규모 정답 라벨에 의존한다. V-Zero는 정답 텍스트 라벨 없이 학생이 샘플한 롤아웃을 교사 쪽의 양/음성 시각 뷰로 평가해 학습 게이트를 조정함으로써 효율적으로 세부 증거 기반 추론 능력을 강화한다.
왜 중요한가
세부 시각 추론은 이미지의 작은 영역에서 증거를 찾아 문맥화해야 하는데, 기존 RL 기반 방법은 탐색 비용이 크고 SFT는 대규모 정답 라벨에 의존한다. V-Zero는 정답 텍스트 라벨 없이 학생이 샘플한 롤아웃을 교사 쪽의 양/음성 시각 뷰로 평가해 학습 게이트를 조정함으로써 효율적으로 세부 증거 기반 추론 능력을 강화한다.
핵심 기여
OPD의 negative-free stop-gradient 정렬 관점 제시
On-Policy Distillation(OPD)을 stop-gradient 기반의 비음수 정렬 객체로 재해석해 OPD가 토큰 수준의 밀집 수정은 제공하지만 롤아웃 전체의 궤적 수준 판별(trajecotry-level discrimination)이 결여되어 한계가 발생함을 규명했다.
Contrastive Evidence Gating 기반의 V-Zero 프레임워크
학생이 전체 이미지에서 생성한 여러 sibling rollouts에 대해 교사가 동일 토큰 시퀀스를 양성(정답 영역 crop)·음성(무관 영역 다운샘플드 crop) 뷰에서 재생해 토큰별 로그확률 차이 Δ_k를 계산하고, 이를 롤아웃 평균 p(g)로 집계·정규화한 뒤 a(g)= (p−μ)/σ를 클리핑해 가중치 w(g)=clip(1+a,g)로 OPD 손실을 게이팅한다. 음성 뷰는 게이팅에만 사용하고 최종 증류 타깃은 양성 뷰이다.
학습 효율성과 무라벨 학습
정답 텍스트 라벨과 외부 보상 없이 교사 측의 양/음성 시각 증거만으로 학습해 Qwen3.5-4B 기본 모델 대비 평균 +3.1점 성능 향상과 SFT 대비 학습비용 >5×, RL 대비 >10×의 벽시계상 속도 향상을 보고했다. 코드·데이터셋은 공개 예정(https://github.com/eVI-group-SCU/V-Zero).
핵심 아이디어 이해하기
출발점과 기존 한계: 멀티모달 LLM(MLLM)이 세부 시각 증거에 기반한 추론을 수행하려면 모델이 이미지의 국지적 영역을 근거로 답을 생성해야 한다. Supervised Fine-tuning(SFT)은 대규모 정답 추론 라벨에 의존하고, RL 기반 agentic 방법은 탐색 비용과 검증 규칙 설계 비용이 크다. On-Policy Distillation(OPD)은 학생이 실제 방문한 상태들에서 교사의 밀집 토큰 신호로 학습해 비용적으로 유리하지만, 표준 OPD는 각 접두(prefix)에 대한 토큰 수준 정렬만 수행해 전체 롤아웃이 올바른 경로인지 판별하지 못한다.
방법론
전체 접근과 핵심 아이디어: V-Zero는 학생이 전체 이미지에서 G개의 sibling rollouts를 샘플링하도록 유지하면서, 교사는 동일 토큰 시퀀스를 원본(full image) 외에 양성(positive)과 음성(negative) 시각 뷰와 함께 재생한다. 각 토큰 k에 대해 교사는 양성·음성 뷰에서의 로그확률 ℓ_{+,k}, ℓ_{-,k}를 계산하고 그 차이 Δ_k = ℓ_{+,k} − ℓ_{-,k}를 구한다. 토큰별 Δ_k를 롤아웃 평균 p^{(g)}로 집계한 뒤, sibling 그룹 내 정규화(μ,σ)로 a^{(g)}를 얻고 w^{(g)} = stop-gradient(clip(1 + a^{(g)}, w_min, w_max))로 게이트를 만든다. 최종적으로 음성 뷰는 게이팅 산출에만 사용되고 positive-view OPD(교사 분포는 π_t(·|x,z^+,...))가 학습 타깃이 된다.
관련 Figure

이 그림은 SFT가 정답 라벨에 의존하고 RL이 보상 탐색을 요구하는 반면, OPD는 학생이 방문한 상태들에 대한 토큰 수준 정렬만 제공해 롤아웃 전체의 올바름을 판별하지 못함을 시각화한다. V-Zero는 이 한계를 극복하기 위해 교사 측의 양/음성 뷰 비교로 롤아웃 단위의 신뢰도를 계산해 OPD 업데이트를 게이팅하는 접근을 정당화한다.
SFT, RL, OPD의 차이와 OPD의 한계를 비교한 개념적 도식.

프롬프트 예시는 학습 시 교사에게는 원본 이미지와 함께 'The next image is a cropped view...' 형태로 양성 크롭이 주어지는 반면, 학생은 전체 이미지만 받는 실험 설정을 명확히 보여 학습/추론 시 입력 차이를 구체적으로 문서화한다.
학생·교사 프롬프트 포맷 예시로 교사에게는 추가적인 crop 프롬프트가 포함됨을 나타냄.
주요 결과
메인 벤치마크 결과: V-Zero-4B는 여러 fine-grained visual reasoning 벤치마크에서 Qwen3.5-4B 대비 평균 +3.1점 향상을 보고했다. 개별 향상치는 VStar +4.7, HR-4K +3.4, HR-8K +2.0, ZoomBench +5.5이다(Table 1). 비교군에는 Qwen3-VL/Qwen3.5(다양한 스케일) 및 DeepEyes, ZwZ, Pixel-Reasoner 등 visually grounded reasoning 시스템이 포함된다.
관련 Figure

세부 질의(프레임 포스터 제목, 속도 표지, 차량 위치)에서 V-Zero가 대상 영역을 더 명확히 강조해 시각적 근거 기반 추론 능력이 향상된 점을 실험적으로 입증한다. 이 시각화는 결과 섹션의 성능 향상 근거(예: VStar, ZoomBench 개선)와 직접 연결된다.
다수 방법의 attention/heatmap 비교로 V-Zero가 정답 근처 지역에 더 강하게 집중하는 예시 시각화.
기술 상세
아키텍처 및 학습 흐름: 학생 정책 π_s는 전체 이미지와 질문을 입력받아 G개의 sibling 롤아웃 y^{(g)}을 autoregressive하게 생성한다. 교사 π_t는 각 학생 접두(y_{<k}^{(g)})에 대해 원본 컨텍스트에 양성 크롭 z^{+} 또는 음성 크롭 z^{-}을 추가해 샘플된 토큰의 로그확률 ℓ_{+,k}, ℓ_{-,k}를 계산한다. 음성 크롭은 원본 이미지를 2×로 다운샘플한 뒤 질문 관련 영역 외부에서 동일 사이즈로 무작위 샘플링한다(학습 전용).
관련 Figure

이 다이어그램은 학생이 전체 이미지에서 G개의 sibling rollouts를 샘플하고, 교사가 동일 시퀀스를 양성/음성 뷰로 재생해 토큰별 로그확률 차이를 계산한 뒤 그룹 내 정규화·클리핑을 통해 w(g)를 산출하고 최종 distillation 손실에 가중치를 적용하는 전체 연산 흐름을 상세히 보여 V-Zero 알고리즘의 구현적 핵심을 직접 연결한다.
V-Zero 전체 파이프라인: 학생 롤아웃, 교사 양/음성 뷰 재생, 증거 게이트 계산 및 게이팅된 OPD 손실.
한계점
논문 명시 한계: HR-8K 벤치마크에서는 gating 효과가 작게 관찰되며(원문은 8K 설정에서 전체 이미지 정보가 충분하다고 명시), 서로 다른 백본·설계 차이로 인한 교차 시스템 비교는 엄격한 컨트롤이 아님을 경고한다. 또한 학습에 교사 모델과 paired crops가 필요해 학습 단계에서는 추가 데이터(크롭) 구성이 요구된다.
실무 활용
V-Zero는 학습 시점에만 교사 측의 양성/음성 크롭을 필요로 하며, 추론 시점에는 표준 full-image 입력으로 동작한다. 구현된 코드와 데이터셋이 공개되어 실무에 적용 가능하다.
- MLLM을 사용한 고해상도 이미지에서의 세부 질문 응답 성능 향상
- 시각 QA 애플리케이션에서 보조 라벨(텍스트 정답) 없이 지역 증거 기반 모델 개선
- 데이터 라벨링 비용이 제한적인 환경에서의 모델 튜닝(라벨 없는 증류 대안)
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- On-Policy Distillation (OPD)
- — 학생(student) 모델이 자체적으로 샘플링한 롤아웃(trajectory)을 고정된 교사(teacher) 분포와 토큰 단위로 정렬시켜 교사를 모방하는 학습법이다. 본문에서는 학생이 만든 접두(prefix)에 대해 교사가 제공한 토큰 확률을 기준으로 reverse-KL 기반의 밀집한 수정 신호를 계산한다.
- Reverse-KL
- — 교사 분포 π_t와 학생 분포 π_s가 주어질 때 ∑_v π_s(v) log(π_s(v)/π_t(v))를 계산하는 거리 척도이다. 본문에서는 학생 샘플 토큰을 이용한 샘플드 토큰 추정량을 손실로 사용해 학생을 교사 분포로 정렬시킨다.
- Stop-Gradient
- — 연산에서 특정 값의 기울기를 차단해 파라미터 업데이트에 영향을 주지 않게 하는 기법이다. 본문에서는 교사 쪽 로그확률이나 게이트 계산의 일부를 stop-gradient로 처리해 학생 업데이트 경로를 분리한다.
- Contrastive Evidence Gating
- — 교사에게 양성(positive)과 음성(negative) 시각 증거 뷰를 제공해 동일한 학생 롤아웃을 두 뷰에서 재생한 뒤, 토큰 단위 로그확률 차이를 평균해 롤아웃 수준의 증거 우위를 계산하고 이 값을 정규화·클리핑해 OPD 손실에 가중치로 적용하는 메커니즘이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.