본문으로 건너뛰기
HF Daily Papers조회 1

대형 언어 모델을 위한 온폴리시 증류(On-Policy Distillation) 서베이

기존의 정적인 데이터 학습 방식(Off-policy)은 모델이 스스로 생성한 오류에 대처하지 못하는 '노출 편향' 문제를 야기한다. 이 논문은 모델이 직접 생성한 결과물에 대해 피드백을 받으며 학습하는 '온폴리시 증류' 기술을 체계적으로 정리하여, 더 작고 효율적이면서도 강력한 추론 능력을 갖춘 모델 제작의 이정표를 제시한다.

용어 해설

노출 편향(Exposure Bias)
학습 시에는 항상 정답 토큰(Ground-truth)만 입력받던 모델이, 실제 추론 시에는 자신이 생성한 오류가 포함된 토큰을 입력받으며 에러가 눈덩이처럼 불어나는 현상이다. 자기회귀 모델의 성능 저하를 일으키는 핵심 원인으로 지목된다.
f-디버전스(f-Divergence)
두 확률 분포 간의 차이를 측정하는 일반화된 수학적 지표이다. KL Divergence, Jensen-Shannon Divergence 등을 하위 개념으로 포함하며, 지식 증류에서 스승과 학생 모델의 출력 분포를 일치시키는 목적 함수로 사용된다.
모드 탐색(Mode-seeking)
확률 분포의 여러 정점 중 가장 확률이 높은 하나의 정점(Mode)에만 집중하여 학습하려는 성질이다. Reverse KL Divergence의 특징이며, 일관되고 명확한 답변이 필요한 수학적 추론 모델 학습에 주로 활용된다.
로짓(Logit)
모델의 마지막 레이어에서 출력되는 가공되지 않은 수치 데이터이다. Softmax 함수를 거치기 전의 값으로, 각 클래스에 대한 모델의 상대적 확신도를 담고 있어 지식 증류 시 '다크 지식'을 전달하는 핵심 매개체가 된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 01.수집 2026. 04. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.