본문으로 건너뛰기

OPD는 정말 교사 지식을 증류하는가

OPSA는 교사·보상·정답 없이 낮은 확률 토큰을 엔트로피에 따라 억제해 추론 성능을 높입니다.

용어 해설

온폴리시 증류(On-Policy Distillation)
학생 모델이 직접 생성한 응답에 대해 교사 모델이 토큰별 확률을 계산하고, 두 모델의 확률 차이로 학습 신호를 만드는 방법입니다. 학생의 실제 생성 분포를 사용하지만 교사는 학생이 만든 접두사를 직접 생성하지 않았기 때문에 분포 불일치와 지도 노이즈가 발생할 수 있습니다.
검증 가능한 보상을 활용한 강화학습(Reinforcement Learning with Verifiable Rewards)
수학 답안처럼 정답 여부를 자동 검증할 수 있는 결과에 보상을 부여하고, 여러 응답의 보상을 비교해 정책을 업데이트하는 강화학습 방식입니다. 응답 전체에 보상이 붙으므로 긴 추론 과정의 개별 토큰에는 희소하고 거친 학습 신호만 전달됩니다.
역방향 쿨백-라이블러 발산(Reverse Kullback–Leibler Divergence)
학생 분포에서 토큰을 표본 추출한 뒤 학생 확률과 교사 확률의 차이를 측정하는 분포 거리입니다. OPD에서는 학생이 만든 접두사와 토큰을 교사가 평가하며, 교사 확률이 학생보다 낮으면 해당 토큰에 음의 advantage가 부여됩니다.
토큰 엔트로피(Token Entropy)
특정 위치에서 다음 토큰 확률이 여러 후보에 얼마나 분산되어 있는지를 나타내는 불확실성 척도입니다. OPSA는 낮은 확률 토큰 중에서도 엔트로피가 높은 위치에 더 큰 음의 학습 신호를 주어, 꼬리 토큰은 억제하고 주요 후보 사이의 탐색은 유지합니다.
음의 어드밴티지(Negative Advantage)
선택된 토큰의 로그확률을 낮추는 방향으로 정책을 업데이트하는 학습 신호입니다. 이 논문에서는 학생이 낮은 확률로 생성한 토큰에 음의 값을 부여해 가능성이 낮은 추론 경로를 억제하며, 고정값만 사용해도 OPD의 상당한 개선을 재현할 수 있음을 확인했습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 31.수집 2026. 09. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.