본문으로 건너뛰기
HF Daily Papers조회 1

Direct On-Policy Distillation(Direct-OPD)를 통한 약모델에서 강모델로의 일반화

작은 모델에서 실행한 RL이 만든 정책 변화의 로그비를 암묵적 보상으로 읽어 강한 학생의 온폴리시 상태에 적용하는 Direct-OPD가 여러 학생 모델에서 AIME 성능을 일관되게 향상시켰다.

추가 이미지 분석

JustRL 전이 동안 학생과 교사 엔트로피 및 엔트로피 차이의 훈련 단계별 진화를 보여주는 진단 플롯이다.
Chart

학생의 엔트로피가 붕괴하지 않으면서 교사와 레퍼런스 간 엔트로피 격차가 줄어드는 경향이 관찰된다. 이러한 패턴은 Direct-OPD가 단순한 분포 샤프닝이나 붕괴가 아니라 후보 간 상대적 순위를 재조정하는 식으로 작동함을 시사한다.

JustRL 전이 동안 학생과 교사 엔트로피 및 엔트로피 차이의 훈련 단계별 진화를 보여주는 진단 플롯이다.

용어 해설

온폴리시 증류(On-Policy Distillation)
학생 모델이 스스로 샘플한 상태(state)에서 교사 모델의 다음 토큰 분포를 밀도 형태로 모방하여 학습하는 기법으로, 본문에서는 학생의 온폴리시 상태에 대해 토큰 단위의 KL 기반 신호를 공급하는 핵심 인터페이스 역할을 수행한다.
KL 규제 강화학습(KL-regularized RL)
목적함수에 정책과 기준(policy reference) 사이의 KL 항을 포함하여 급격한 정책 이동을 억제하는 강화학습 형태로, 정책-참조 로그비(log-ratio)가 암묵적 보상(reward)을 복원하는 수식적 근거를 제공한다.
암묵적 보상(Implicit Reward)
포스트-RL 교사와 그 이전 체크포인트의 로그 확률 차이(log-ratio)를 보상 신호로 해석하는 개념으로, 별도의 보상 모델 없이 정책 쌍에서 직접 보상 정보를 읽어 학생 모델로 이전하는 수단이다.
Top-k 제한(Top-k Restriction)
학생이 고려하는 행동 집합을 자신의 상위 k개 후보로 국한하고 해당 후보들에 대해 교사의 로그비를 평가하는 근사 방식으로, 분산을 낮추고 실제 학생 분포 내에서만 신호를 적용하도록 만든다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.