본문으로 건너뛰기

On-Policy Delta Distillation (OPD²)

교사 모델과 그 베이스 모델 간 로그확률 차이인 델타 신호를 중심으로 한 OPD²는 센터링과 부호 일치 조건을 결합하여 다양한 수학·과학·코드 추론 벤치마크에서 기존 OPD 대비 일관된 성능 향상을 보였다.

용어 해설

온-폴리시 증류(On-Policy Distillation)
학생 모델의 자체 롤아웃 샘플에 대해 교사 모델의 토큰 수준 확률 차이를 보상 신호로 사용하여 학생을 미세조정하는 기법이다. 학습 신호가 학생이 실제 생성하는 상태에만 적용되므로 train–inference 불일치(exposure bias)를 완화한다. 본문에서는 OPD가 기저 방법으로 사용되며 델타 신호와 결합되어 OPD²로 확장되었다.
델타 신호(Delta Signal)
교사 모델의 추론 특성(추론 튜닝 후)과 그 교사 베이스(포스트트레이닝 이전) 사이의 로그확률 차이로 정의된 토큰 수준 보상 신호이다. 델타 신호는 추론 튜닝에서 새로 획득한 지식의 변화량을 직접적으로 포착하므로 추론 능력 전수에 초점을 맞춘다. 본 논문은 이 신호를 주된 학습 목표로 사용하여 on-policy distillation을 개선했다.
센터링(보상 중심화)(Centering)
샘플된 토큰에 대한 보상에서 정책(학생) 하에서의 기대 보상을 빼는 조작으로 보상의 편향을 제거한다. 이렇게 하면 보상 신호의 방향성을 명확히 하고 단일 부호 편향으로 인한 학습 불안정을 완화할 수 있다. OPD²는 델타 신호에 센터링을 적용한 advantage를 사용한다.
교사 베이스 모델(Teacher Base Model)
교사 모델이 추론 튜닝을 받기 이전의 동일 아키텍처 초기 모델을 의미하며, 델타 신호는 교사 모델과 이 베이스 모델 간의 확률 차이로 계산된다. 베이스 모델이 교사의 사전 학습·스타일·기본 선호를 반영하므로 델타는 추론 튜닝으로 얻은 변화만 분리하는 역할을 한다. OPD²는 교사·교사베이스·학생 모두의 전방 연산을 필요로 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.