본문으로 건너뛰기

학생 이미지만 약화한 시각 자기 증류

학생 이미지에만 시각 변형을 적용해 만든 비대칭 증류로 Qwen3.5-4B의 지각 평균 정확도를 70.68%에서 77.44%로 높였습니다.

용어 해설

온폴리시 지식 증류(On-Policy Distillation)
학생 모델이 실제 추론 과정에서 직접 생성한 토큰 시퀀스를 따라 교사 모델의 다음 토큰 분포를 학습하는 방법입니다. 학습 데이터의 정답만 모방하는 대신 학생이 방문한 상태에서 토큰별 예측 차이를 줄여 학습과 추론 사이의 불일치를 낮추는 데 의미가 있습니다.
지수 이동 평균(Exponential Moving Average)
현재 학생 모델의 가중치와 이전 교사 가중치를 결합해 교사 모델을 점진적으로 갱신하는 방식입니다. 논문에서는 phi(1η)ϕ+ηθphi \leftarrow (1-\eta)\phi+\eta\theta로 표현하며, 학생의 순간적인 변화보다 안정적인 예측 분포를 교사 신호로 사용하기 위해 적용합니다.
Jensen–Shannon 발산(Jensen–Shannon Divergence)
두 확률분포와 이들의 혼합분포 사이의 KL 발산을 평균해 분포 차이를 측정하는 지표입니다. S 2 VOPD는 교사와 학생의 토큰분포를 가중치 alpha=0.5alpha=0.5로 결합한 뒤 양쪽의 KL 발산을 모두 계산해, 한쪽 분포에만 과도하게 맞추는 문제를 줄입니다.
온폴리시 자기 증류(On-Policy Self-Distillation)
별도의 강한 교사 모델 없이 하나의 모델에서 교사와 학생 역할을 나누어 자기 생성 궤적을 학습하는 방법입니다. 기존 방식은 정답 답안, 환경 보상, 관심 영역처럼 교사에게만 주어지는 privileged information으로 비대칭을 만들지만, 이 논문은 학생 입력에서 시각 정보를 제거하는 방식으로 같은 목적을 달성합니다.
EMA 교사 모델(EMA Teacher)
학생 모델 가중치의 지수 이동 평균으로 유지되는 교사 네트워크입니다. S 2 VOPD에서는 교사가 원본 이미지를 보고 학생은 변형 이미지를 보도록 입력을 분리하며, 교사는 학생이 생성한 동일한 접두부에서 더 많은 시각 정보에 기반한 토큰분포를 계산합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 14.수집 2026. 08. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.