용어 해설
- 온폴리시 증류(On-Policy Distillation)
- — 학생 모델이 직접 생성한 응답에 대해 교사 모델이 토큰별 확률을 계산하고, 두 모델의 확률 차이로 학습 신호를 만드는 방법입니다. 학생의 실제 생성 분포를 사용하지만 교사는 학생이 만든 접두사를 직접 생성하지 않았기 때문에 분포 불일치와 지도 노이즈가 발생할 수 있습니다.
- 검증 가능한 보상을 활용한 강화학습(Reinforcement Learning with Verifiable Rewards)
- — 수학 답안처럼 정답 여부를 자동 검증할 수 있는 결과에 보상을 부여하고, 여러 응답의 보상을 비교해 정책을 업데이트하는 강화학습 방식입니다. 응답 전체에 보상이 붙으므로 긴 추론 과정의 개별 토큰에는 희소하고 거친 학습 신호만 전달됩니다.
- 역방향 쿨백-라이블러 발산(Reverse Kullback–Leibler Divergence)
- — 학생 분포에서 토큰을 표본 추출한 뒤 학생 확률과 교사 확률의 차이를 측정하는 분포 거리입니다. OPD에서는 학생이 만든 접두사와 토큰을 교사가 평가하며, 교사 확률이 학생보다 낮으면 해당 토큰에 음의 advantage가 부여됩니다.
- 토큰 엔트로피(Token Entropy)
- — 특정 위치에서 다음 토큰 확률이 여러 후보에 얼마나 분산되어 있는지를 나타내는 불확실성 척도입니다. OPSA는 낮은 확률 토큰 중에서도 엔트로피가 높은 위치에 더 큰 음의 학습 신호를 주어, 꼬리 토큰은 억제하고 주요 후보 사이의 탐색은 유지합니다.
- 음의 어드밴티지(Negative Advantage)
- — 선택된 토큰의 로그확률을 낮추는 방향으로 정책을 업데이트하는 학습 신호입니다. 이 논문에서는 학생이 낮은 확률로 생성한 토큰에 음의 값을 부여해 가능성이 낮은 추론 경로를 억제하며, 고정값만 사용해도 OPD의 상당한 개선을 재현할 수 있음을 확인했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

