본문으로 건너뛰기

온-폴리시 증류: 강화학습의 효율성과 증류의 밀도 높은 보상을 결합한 LLM 사후 학습

학생 모델의 샘플을 교사 모델이 토큰 단위로 평가하는 온-폴리시 증류 기법을 통해 강화학습 대비 최대 100배의 계산 효율로 고성능 소형 모델을 구축할 수 있다.

섹션별 상세

기존의 오프-폴리시 증류는 교사의 데이터만 모방하므로 학생 모델이 스스로 저지른 실수를 복구하는 능력을 배우지 못해 긴 시퀀스에서 오류가 누적된다. 온-폴리시 증류는 학생이 직접 생성한 샘플(Rollout)을 교사가 평가하게 함으로써 학생이 자주 빠지는 오류 상태에서 벗어나는 법을 직접 학습하게 한다.
체스 분석 엔진이 각 수의 품질을 색상별로 등급화하여 보여주는 스크린샷
Screenshot체스 학습 비유를 통해 온-폴리시 증류의 핵심 개념을 설명한다. 단순히 게임의 승패(희소 보상)만 아는 것이 아니라, 매 수마다 '실수'인지 '최선의 수'인지 실시간 피드백(밀도 높은 보상)을 받는 것이 학습 효율을 극대화함을 시각화한다.
강화학습은 최종 결과에 대해서만 보상을 주는 희소 피드백 구조인 반면, 온-폴리시 증류는 교사 모델의 로그 확률을 활용해 모든 토큰 단계에서 보상을 제공한다. 이러한 밀도 높은 보상 신호 덕분에 동일한 성능 도달에 필요한 그래디언트 업데이트 횟수가 RL 대비 약 7~10배 적게 소요된다.
근거
  • 온-폴리시 증류는 RL 대비 약 50-100배의 계산 효율 향상을 제공한다. Discussion - Dense supervision greatly improves compute efficiency 섹션
수학 추론 벤치마크인 AIME'24에서 Qwen3-8B 모델을 학습시킨 결과, 온-폴리시 증류는 RL 대비 10분의 1 수준의 GPU 시간으로 더 높은 점수(74.4%)를 기록했다. 이는 교사 모델의 순방향 패스 한 번으로 보상을 계산할 수 있어 계산 비용이 획기적으로 절감되기 때문이다.
근거
  • Qwen3-8B 모델은 온-폴리시 증류를 통해 AIME'24 벤치마크에서 74.4%를 달성했다. Distillation for reasoning - Reinforcement learning 비교 표
새로운 도메인 지식을 학습(Mid-training)할 때 기존의 지시 이행(Instruction Following) 능력이 퇴화하는 '치명적 망각' 현상이 발생한다. 온-폴리시 증류를 통해 이전 버전의 모델을 교사로 삼아 자가 증류를 수행하면, 학습된 지식은 유지하면서 손실된 비서 능력을 거의 완벽하게 복구할 수 있다.
데이터 효율성 측면에서 온-폴리시 증류는 단 하나의 프롬프트만으로도 여러 번의 에포크 학습이 가능하며 교사의 성능을 복제할 수 있다. RL이 동일 프롬프트 반복 시 정답 암기에 치중하는 것과 달리, 증류는 교사의 전체 분포를 근사하므로 과적합 위험이 낮고 데이터 수집 부담을 줄여준다.
근거
  • 단 하나의 프롬프트로 20단계 연속 학습을 수행해도 교사의 성능을 거의 복제할 수 있다. Discussion - Distillation can effectively reuse training data 섹션

기술

  • Qwen3
  • Tinker API
  • LoRA
  • Reverse KL

활용 사례

  • 수학 및 논리 추론 특화 모델 학습
  • 기업 내부 문서 기반 전문 비서 구축
  • 지속적 학습을 통한 모델 지식 업데이트

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 07.수집 2026. 05. 07.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.