왜 중요한가
멀티모달 모델의 오답 대부분은 초기 시각적 인식 오류에서 시작되며, 온-폴리시 증류는 학생 생성 상태에서 교사 지시를 받아 이런 오류를 교정할 기회를 제공한다. 그러나 교사의 다음-토큰 수정은 시각 신호와 언어 우선 정보, 교사 특유의 효과가 섞인 source-mixed 형태여서 어떤 수정이 실제로 이미지 증거에 기인하는지 판단하기 어렵다. VAD는 증거를 인위적으로 드러내거나 제거한 동일 교사 호출의 차이를 프록시로 삼아 교사 수정 중 시각 근거로 설명 가능한 성분만을 학생 중심 목표로 재구성함으로써 더 정확하고 근거 있는 시각 지도 신호를 만든다.
핵심 기여
시각 근거 귀속 및 학생-중심 목표 재구성
VAD는 동일 교사와 학생 prefix에서 증거-제시 및 증거-제거 뷰를 비교해 중심화 로그확률 차이 를 구하고, 교사 수정 r_t를 이 프록시에 한쪽 투사하여 시각 귀속 성분 r_t^{vis}만을 학생 분포에 더해 재구성된 목표 q_{T,t}^{VAD}를 만든다. 이 방식은 교사의 전체 분포를 그대로 복제하지 않고 시각적으로 정당화된 토큰 확률 변화만을 반영해 학습 안정성과 근거성을 동시에 확보한다. 추가적으로 지원과 반박(support/refutation)을 분리해 예측된 시각 증거의 방향성에 따라 후보 토큰을 올리거나 내리도록 예산을 배분한다.
프록시 기반 분해의 통계적·어휘적 검증
토큰 수준 분석에서 r_t^{vis}는 색상·재질·객체·A–D 답안 기호 등 결정적 시각 정보와 연관성이 높았고, 잔여 성분 r_t^{res}는 언어적 스캐폴딩과 포맷 관련 토큰에 더 치중했다. 이 정량적·어휘적 분리는 프록시 투사가 단순한 크기 축소가 아니라 의미론적 재배치를 수행했음을 지지한다. 오프라인 고정 슬롯 실험에서도 재구성 목표가 정답 토큰 지지도와 오답 억제를 동시에 강화하는 것으로 관찰되었다.
광범위한 벤치마크에서의 성능 우위
Qwen3.5 기반 4B·9B 학생을 동일 데이터와 업데이트 예산으로 후처리한 통제 실험에서 VAD는 Avg_6에서 각각 78.32%와 79.93%를 달성해 동일 계열 대안들(예: Vision-OPD, Decomposed OPD)보다 평균 2~3 포인트 우수한 성능을 보였다. 또한 여러 보류(held-out) 벤치마크에서 Base 수준의 일반화 성능을 유지해 시각 특화가 전반적 역량을 훼손하지 않음을 확인했다.
핵심 아이디어 이해하기
온-폴리시 증류는 학생이 실제 생성하는 prefix에서 교사 분포를 쿼리하므로 학생 배포에 직접 맞추어 보정할 수 있다. 그러나 privileged-view 교사가 제시하는 전체 수정 r_t는 시각 증거, 언어 우선(prior), 교사 특유 출력 스타일이 혼합된 source-mixed 방향이다. VAD는 같은 교사·prefix에서 증거를 포함한 뷰와 제거한 뷰의 중심화 로그확률 차이 를 계산해 그 변화를 시각 증거의 '방향' 프록시로 사용하고, 를 이 프록시에 한쪽 투사해 시각 근거로 설명 가능한 성분만 골라 학생의 현재 분포에 더해 재구성된 목표를 만든다.
방법론
학습 시 입력으로 전체 이미지 x^0와 학생이 샘플한 응답 y를 사용하고, 교사의 고정 복사본에 대해 증거-제시 x^{+}와 증거-제거 x^{-} 뷰를 동일 prefix y_{<t}로 질의한다. 세 분포 p_S^0, p_T^{+}, p_T^{-}을 학생 상위 K 후보를 기준으로 동일 토큰 집합 V_t 위에서 중심화(log+ε 평균 제거)해 벡터화하고 , 를 계산한다. 그다음 일방 투사와 분기별 예산 배분을 통해 r_t^{vis} 또는 r_t^{VAD}를 구성해 학생 중심 logits에 더하고, 정지된(target-side) 분포에 대해 토큰 수준 Jensen–Shannon 발산으로 학습한다.
주요 결과
통제된 동일 초기화와 업데이트 예산 실험에서 Qwen3.5-4B 학생은 VAD 적용 후 Avg_6 78.32%를 얻어 같은 규모 대안보다 최대 2.40 포인트 높은 성과를 냈고, Qwen3.5-9B 학생은 Avg_6 79.93%로 동급 대안보다 최대 2.80 포인트 우수했다. 타겟 구성 비교에서는 분기-aware 재구성이 약 1.0 포인트, 약한 교사 정규화가 추가로 약 0.26~0.8 포인트의 누적 향상을 제공했다. 오프라인 슬롯 실험에서 정답 토큰 지지도는 최대 7.89 퍼센트포인트, 오답 억제는 최대 6.61 퍼센트포인트 수준의 변화를 기록해 재구성 목표가 양 방향 모두에 기여함을 확인했다.
관련 Figure

그래프는 VAD에 해당하는 막대에서 정답 지원과 오답 억제가 가장 큰 쪽으로 이동하는 추세를 보여 시각 관련 프록시 정렬이 정답 토큰 확률을 상대적으로 더 올리고 잘못된 토큰 확률을 더 낮춘다는 정성적 근거를 제공한다. 막대 끝의 수치 레이블은 정답 지원이 7.52→7.89, 오답 억제가 6.29→6.61 포인트로 증가하는 점을 표시해 재구성 목표의 방향성 영향을 직접적으로 수치화한다.
오프라인 답안 슬롯 분석의 막대 그래프으로, 네 가지 타깃 구성(교사 수정, 스칼라 축소, 단일 측면 투사, VAD 재구성 등)에 대해 정답 지지도와 오답 억제 효과를 퍼센트포인트로 비교한다.
기술 상세
프록시와 투사 연산은 중심화된 로그확률을 기초로 한다: 이며 프록시는 로 정의된다. 교사 수정과의 일방 투사는 , 로 계산되어 음의 상호작용을 배제하고 시각적으로 일치하는 성분만 추출한다. 이후 지원과 반박 분기를 나눠 정규화된 방향에 예산 B_t=\lVert r_t^{vis}\rVert_2을 재분배하고 클리핑 범위 c와 양성 캡 τ_{+}으로 안정화한 후 학생 중심 logits에 더해 를 목표로 JSD 손실을 최적화한다.
관련 Figure

이 시각화는 (λ,τ_{+}) 주위에 넓은 최적 영역이 존재해 학습 결과가 특정 값에 과민하지 않음을 보여주며, 논문이 채택한 (0.10,0.80) 설정이 최고 근처에 위치함을 시각적으로 지원한다. 색상 바와 수치 눈금은 성능이 약 76.8%에서 78.3%까지 변화하는 범위를 명확히 전달해 하이퍼파라미터 안정성 판단에 사용될 수 있다.
3D 바 차트 형태의 하이퍼파라미터 스윕 시각화로, 정규화 가중치 λ와 양성 캡 τ_{+} 변화에 따른 Avg_6 성능(퍼센트)을 색상과 높이로 나타낸다.
한계점
각 개입은 한 쌍의 증거-제시/제거 뷰로 표현되므로 복합적·조합적 증거가 있는 장면에서는 프록시가 부분적 편향을 가질 수 있다. 투사 연산은 시각 근거 성분을 농축하지만 완전한 분리(identifiable separation)를 보장하지 않으며, 귀속된 성분에 비시각적 교사 효과가 남을 가능성이 있다. 또한 훈련 단계에서 추가 교사 호출 비용과 뷰 생성이 요구되므로 대규모 데이터나 실시간 학습 파이프라인에 적용할 때 계산·운영상의 고려가 필요하다.
실무 활용
VAD는 추가 교사 호출과 증거-제시/제거 뷰를 학습 시에만 필요로 하며, 추론 시에는 표준 전체 이미지 학생 모델을 그대로 사용해 실무 배포 비용을 증가시키지 않는다. 이 특성으로 인해 기존 온-폴리시 증류 파이프라인에 후처리 단계로 통합하기 용이하다. 공개 코드와 학습 체크포인트가 제공되어 실험적 재현과 확대 적용이 가능하다.
- 고해상도 또는 지역 기반 세부 인식을 요구하는 비주얼 QA와 시각적 디테일 판별 평가에 학생 모델 성능을 개선할 때
- 특권 뷰(크롭, 고해상도 패치)를 교육 시에만 활용하고 추론 비용을 늘리지 않으려는 환경에서
- 교사의 수정 중 어떤 성분이 실제 이미지 증거에 기인하는지 확인해 모델 설명성 또는 근거 기반 응답을 강화할 때
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 온-폴리시 증류(On-Policy Distillation)
- — 학생이 생성한 prefix를 교사에 질의해 학생 배포 상황에 맞춘 교사 분포를 학습 신호로 사용하는 증류 방식으로, autoregressive 생성에서 rollout 데이터의 분포를 일치시키는 역할을 한다.
- 특권 뷰 교사(Privileged-view teacher)
- — 학생이 접근하지 못하는 고해상도 또는 영역 중심의 시각 정보를 입력으로 받는 교사 모델을 뜻하며, 이 교사는 추가 시각 단서를 이용해 학생보다 세밀한 다음-토큰 분포를 제시한다.
- 중심화된 로그확률(Centered log-probabilities)
- — 토큰 지지 집합 상에서 각 확률에 작은 상수 ε를 더한 뒤 로그를 취하고 평균을 빼 공통 오프셋을 제거한 벡터로, 쌍별 로그 오즈는 유지하면서 비교를 용이하게 한다.
- 시각 개입 유도 프록시 u_t(Intervention-derived proxy u_t)
- — 같은 교사·prefix에서 증거-제시 뷰와 증거-제거 뷰의 중심화 로그확률 차이 로 정의되며, 특정 증거가 후보 토큰의 상대 확률을 어느 방향으로 바꾸는지 표시하는 부호 있는 근사 신호이다.
- Jensen–Shannon 발산(Jensen–Shannon divergence (JSD))
- — 두 확률분포 q와 p에 대해 평균 분포 m=(q+p)/2를 만들고 로 계산하는 대칭적 거리 척도로, 본문에서는 토큰 수준 감독에 사용된다.
코드 예제
for minibatch in D:
for x0 in minibatch:
sample y ~ pi_theta(.|x0)
(x+, x-) = V(x0)
for t in 1..|y|:
evaluate p_S0, p_T+, p_T- on prefix y_<t>
compute phi(p) and r_t, u_t
r_vis = one-sided projection of r_t onto u_t
construct q_T_t^VAD and accumulate JSD loss
update theta with loss, keep teacher fixed논문 Algorithm 1의 핵심 루프를 단순화한 의사코드로서, 학생 롤아웃에 대해 교사의 증거-제시·제거 뷰를 평가해 프록시 u_t로 시각성분을 귀속하고 재구성된 목표로 JSD 손실을 계산하는 흐름을 요약한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.