용어 해설
- 온-폴리시 증류(On-Policy Distillation (OPD))
- — 학생(student) 모델이 자체적으로 샘플링한 롤아웃(trajectory)을 고정된 교사(teacher) 분포와 토큰 단위로 정렬시켜 교사를 모방하는 학습법이다. 본문에서는 학생이 만든 접두(prefix)에 대해 교사가 제공한 토큰 확률을 기준으로 reverse-KL 기반의 밀집한 수정 신호를 계산한다.
- 역(Reverse) Kullback-Leibler 발산(Reverse-KL)
- — 교사 분포 π_t와 학생 분포 π_s가 주어질 때 ∑_v π_s(v) log(π_s(v)/π_t(v))를 계산하는 거리 척도이다. 본문에서는 학생 샘플 토큰을 이용한 샘플드 토큰 추정량을 손실로 사용해 학생을 교사 분포로 정렬시킨다.
- stop-gradient(그래디언트 분리)(Stop-Gradient)
- — 연산에서 특정 값의 기울기를 차단해 파라미터 업데이트에 영향을 주지 않게 하는 기법이다. 본문에서는 교사 쪽 로그확률이나 게이트 계산의 일부를 stop-gradient로 처리해 학생 업데이트 경로를 분리한다.
- 대조적 증거 게이팅(Contrastive Evidence Gating)
- — 교사에게 양성(positive)과 음성(negative) 시각 증거 뷰를 제공해 동일한 학생 롤아웃을 두 뷰에서 재생한 뒤, 토큰 단위 로그확률 차이를 평균해 롤아웃 수준의 증거 우위를 계산하고 이 값을 정규화·클리핑해 OPD 손실에 가중치로 적용하는 메커니즘이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




