본문으로 건너뛰기

LLM Reasoning에서 Self-Distillation을 위한 Adaptive Teacher Exposure

OPSD의 기본은 교사가 전체 참조를 보는 설정이다. 이 노출은 쉬운 문제에서 유리하지만 hard 문제에서 학습 흡수를 방해한다. ATESD는 교사 노출을 학습-상태로 조정하고 지연된 보상으로 credit을 부여해 교사–학생 매칭 문제를 완화한다. 실험은 AIME 2024/2025 및 HMMT 2025에서 OPSD 대비 평균@12 점수를 향상시켰다.

용어 해설

노출 알파(Exposure Alpha)
교사에게 공개되는 privileged reasoning의 양을 조절하는 연속 변수 α를 가리키며, 0은 final answer만, 1은 전체 privileged reasoning을 나타낸다. 학습 중에 조정되며 teacher–student KD의 커뮤니케이션 강도를 조절한다.
privileged 코탁(Privileged CoT)
교사는 reference solution의 chain-of-thought를 부분적으로만 보며, student가 받아들일 수 있는 범위 내에서만 부분추론 정보를 제공한다.
베타-정책 컨트롤러(Beta-policy controller)
훈련 상태에 조건화된 beta 분포를 매핑해 α를 샘플링하는 정책으로, hold window 동안의 노출 값을 결정한다.
지연 학습 진행 보상(Delayed Learning-Progress Reward)
노출 결정의 효과를 이후 학습 진행으로 평가하는 보상 구조로, REINFORCE 업데이트에 사용된다.
이중 시계열 학습(Two-Timescale Training)
student 업데이트와 controller 업데이트가 서로 다른 속도로 진행되는 학습 스케줄.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 12.수집 2026. 05. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.