용어 해설
- 약한 모델에서 강한 모델로의 일반화(Weak-to-Strong Generalization)
- — 더 작은 모델이나 불완전한 감독 신호로 학습한 강한 모델이 감독 모델의 성능을 넘어서는 현상이다. 이 논문에서는 약한 Teacher의 후속 학습 성과를 강한 Student의 Verifier 기반 최적화에 연결하되, Student가 Teacher의 정책이나 능력 한계에 묶이지 않도록 하는 것이 핵심 과제다.
- On-Policy Distillation
- — Student가 직접 생성한 응답과 그 과정에서 방문한 prefix를 기준으로 Teacher의 다음 토큰 분포를 조회해 학습하는 방식이다. 학습 데이터의 prefix와 실제 추론 중 방문하는 prefix 사이의 분포 차이를 줄이지만, 일반적인 형태에서는 Student가 Teacher 정책을 직접 모방하는 목표를 갖는다.
- 검증 가능한 보상 기반 강화학습(RLVR)
- — 정답 비교나 코드 실행처럼 프로그램으로 판정할 수 있는 Verifier의 보상을 사용해 언어 모델 정책을 최적화하는 방법이다. Student가 응답을 생성하고 각 토큰의 Advantage를 계산한 뒤 정책 기울기를 갱신하며, OPRD는 이 기울기의 일부만 Teacher 방향에 맞춰 재조정한다.
- 정책 기울기(Policy Gradient)
- — 모델이 선택한 행동의 로그 확률에 Advantage를 곱해 보상 증가 방향을 계산하는 강화학습의 갱신 신호다. 이 논문에서는 토큰별 기울기 $\mathbf{g}_t=A_t abla_{\mathbf{z}_t}\log\pi_\theta(y_t\mid s_t)$를 기준으로 삼고, OPRD가 Teacher 방향 성분만 증폭한다.
- 정지점(Stationary Point)
- — 최적화 기울기가 0이 되어 추가적인 1차 갱신 방향이 사라지는 지점이다. OPRD는 Student 기울기를 대체하지 않고 일부 성분에 0 이상인 배율만 적용하므로, 변환된 기울기가 0인 지점과 원래 기울기가 0인 지점을 일치시킨다.
- 정책 변화량(Policy Shift)
- — Post-training 전후 정책의 상대적인 다음 토큰 선호 변화다. OPRD는 Teacher의 최종 정책 자체가 아니라 RL 학습 전 Reference 정책과 학습 후 Teacher 사이의 Logit 차이를 평균 중심화하고 정규화해 방향 벡터로 사용한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





