추가 이미지 분석

학생의 엔트로피가 붕괴하지 않으면서 교사와 레퍼런스 간 엔트로피 격차가 줄어드는 경향이 관찰된다. 이러한 패턴은 Direct-OPD가 단순한 분포 샤프닝이나 붕괴가 아니라 후보 간 상대적 순위를 재조정하는 식으로 작동함을 시사한다.
JustRL 전이 동안 학생과 교사 엔트로피 및 엔트로피 차이의 훈련 단계별 진화를 보여주는 진단 플롯이다.
용어 해설
- 온폴리시 증류(On-Policy Distillation)
- — 학생 모델이 스스로 샘플한 상태(state)에서 교사 모델의 다음 토큰 분포를 밀도 형태로 모방하여 학습하는 기법으로, 본문에서는 학생의 온폴리시 상태에 대해 토큰 단위의 KL 기반 신호를 공급하는 핵심 인터페이스 역할을 수행한다.
- KL 규제 강화학습(KL-regularized RL)
- — 목적함수에 정책과 기준(policy reference) 사이의 KL 항을 포함하여 급격한 정책 이동을 억제하는 강화학습 형태로, 정책-참조 로그비(log-ratio)가 암묵적 보상(reward)을 복원하는 수식적 근거를 제공한다.
- 암묵적 보상(Implicit Reward)
- — 포스트-RL 교사와 그 이전 체크포인트의 로그 확률 차이(log-ratio)를 보상 신호로 해석하는 개념으로, 별도의 보상 모델 없이 정책 쌍에서 직접 보상 정보를 읽어 학생 모델로 이전하는 수단이다.
- Top-k 제한(Top-k Restriction)
- — 학생이 고려하는 행동 집합을 자신의 상위 k개 후보로 국한하고 해당 후보들에 대해 교사의 로그비를 평가하는 근사 방식으로, 분산을 낮추고 실제 학생 분포 내에서만 신호를 적용하도록 만든다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






