본문으로 건너뛰기

V-Zero: 대조적 증거 게이팅을 이용한 답 라벨 없는 온-폴리시 증류로 세부 시각 추론 향상

세부 시각 추론은 이미지의 작은 영역에서 증거를 찾아 문맥화해야 하는데, 기존 RL 기반 방법은 탐색 비용이 크고 SFT는 대규모 정답 라벨에 의존한다. V-Zero는 정답 텍스트 라벨 없이 학생이 샘플한 롤아웃을 교사 쪽의 양/음성 시각 뷰로 평가해 학습 게이트를 조정함으로써 효율적으로 세부 증거 기반 추론 능력을 강화한다.

용어 해설

온-폴리시 증류(On-Policy Distillation (OPD))
학생(student) 모델이 자체적으로 샘플링한 롤아웃(trajectory)을 고정된 교사(teacher) 분포와 토큰 단위로 정렬시켜 교사를 모방하는 학습법이다. 본문에서는 학생이 만든 접두(prefix)에 대해 교사가 제공한 토큰 확률을 기준으로 reverse-KL 기반의 밀집한 수정 신호를 계산한다.
역(Reverse) Kullback-Leibler 발산(Reverse-KL)
교사 분포 π_t와 학생 분포 π_s가 주어질 때 ∑_v π_s(v) log(π_s(v)/π_t(v))를 계산하는 거리 척도이다. 본문에서는 학생 샘플 토큰을 이용한 샘플드 토큰 추정량을 손실로 사용해 학생을 교사 분포로 정렬시킨다.
stop-gradient(그래디언트 분리)(Stop-Gradient)
연산에서 특정 값의 기울기를 차단해 파라미터 업데이트에 영향을 주지 않게 하는 기법이다. 본문에서는 교사 쪽 로그확률이나 게이트 계산의 일부를 stop-gradient로 처리해 학생 업데이트 경로를 분리한다.
대조적 증거 게이팅(Contrastive Evidence Gating)
교사에게 양성(positive)과 음성(negative) 시각 증거 뷰를 제공해 동일한 학생 롤아웃을 두 뷰에서 재생한 뒤, 토큰 단위 로그확률 차이를 평균해 롤아웃 수준의 증거 우위를 계산하고 이 값을 정규화·클리핑해 OPD 손실에 가중치로 적용하는 메커니즘이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 24.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.