본문으로 건너뛰기
HF Daily Papers조회 1

약한 Teacher의 정책 변화를 강한 Student의 학습 가속 신호로 바꾸는 OPRD

OPRD는 약한 Teacher의 정책 변화 방향과 일치하는 Student의 Verifier 기울기만 증폭해 Teacher 성능을 빠르게 넘는다.

용어 해설

약한 모델에서 강한 모델로의 일반화(Weak-to-Strong Generalization)
더 작은 모델이나 불완전한 감독 신호로 학습한 강한 모델이 감독 모델의 성능을 넘어서는 현상이다. 이 논문에서는 약한 Teacher의 후속 학습 성과를 강한 Student의 Verifier 기반 최적화에 연결하되, Student가 Teacher의 정책이나 능력 한계에 묶이지 않도록 하는 것이 핵심 과제다.
On-Policy Distillation
Student가 직접 생성한 응답과 그 과정에서 방문한 prefix를 기준으로 Teacher의 다음 토큰 분포를 조회해 학습하는 방식이다. 학습 데이터의 prefix와 실제 추론 중 방문하는 prefix 사이의 분포 차이를 줄이지만, 일반적인 형태에서는 Student가 Teacher 정책을 직접 모방하는 목표를 갖는다.
검증 가능한 보상 기반 강화학습(RLVR)
정답 비교나 코드 실행처럼 프로그램으로 판정할 수 있는 Verifier의 보상을 사용해 언어 모델 정책을 최적화하는 방법이다. Student가 응답을 생성하고 각 토큰의 Advantage를 계산한 뒤 정책 기울기를 갱신하며, OPRD는 이 기울기의 일부만 Teacher 방향에 맞춰 재조정한다.
정책 기울기(Policy Gradient)
모델이 선택한 행동의 로그 확률에 Advantage를 곱해 보상 증가 방향을 계산하는 강화학습의 갱신 신호다. 이 논문에서는 토큰별 기울기 $\mathbf{g}_t=A_t abla_{\mathbf{z}_t}\log\pi_\theta(y_t\mid s_t)$를 기준으로 삼고, OPRD가 Teacher 방향 성분만 증폭한다.
정지점(Stationary Point)
최적화 기울기가 0이 되어 추가적인 1차 갱신 방향이 사라지는 지점이다. OPRD는 Student 기울기를 대체하지 않고 일부 성분에 0 이상인 배율만 적용하므로, 변환된 기울기가 0인 지점과 원래 기울기가 0인 지점을 일치시킨다.
정책 변화량(Policy Shift)
Post-training 전후 정책의 상대적인 다음 토큰 선호 변화다. OPRD는 Teacher의 최종 정책 자체가 아니라 RL 학습 전 Reference 정책과 학습 후 Teacher 사이의 Logit 차이를 평균 중심화하고 정규화해 방향 벡터로 사용한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.