본문으로 건너뛰기

Trust Region Policy Distillation (TOP-D): 보상 분산을 상한으로 묶어 OPD 최적화를 안정화한 방법

TOP-D는 교사와 학생 확률을 α로 보간해 로그 보상을 하한으로 묶고 내부 trust region 반복으로 오프라인 데이터를 안전하게 재사용하여 그래디언트 분산을 제어하고 AIME 벤치마크에서 OPD 대비 최대 25.84%p 절대 향상을 기록했다.

용어 해설

근접 교사 분포(Proximal Teacher)
교사 모델과 현재 학생 정책의 확률을 α로 보간하여 만든 대체 확률분포로서, 로그 확률비를 직접 사용하지 않고 αρ + 1 − α 형태의 보상을 계산해 로그 보상의 하한을 보장함으로써 극단적 음의 보상으로 인한 분산 폭주를 막는다.
중요도 샘플링(Importance Sampling)
행동 중요도 비율 p_t = π_θ(y_t|·)/π_{θ_old}(y_t|·)을 통해 다른 정책으로 생성된 토큰을 재사용하여 손실을 추정하는 기법으로, TOP-D에서는 내부 trust region 반복에서 오프라인 롤아웃을 재활용해 샘플 효율을 높인다.
토큰 수준 이점 정규화(Token-level Advantage Normalization)
동일 프롬프트에 대해 생성된 여러 응답의 토큰별 반환값을 그룹 단위로 평균과 표준편차로 정규화하여 토큰 수준의 이점을 계산함으로써 길이 편향을 줄이고 조밀한 보상 신호를 더 잘 활용하는 정규화 절차이다.
역 KL 발산(Reverse KL)
학생 분포 π_θ를 교사 분포 π^*에 근사시키기 위해 사용되는 불평등성으로, OPD에서는 기대 로그비(log π^*/π_θ)를 최대화하는 형태로 학습 목표가 정의되어 교사-학생 확률 불일치가 로그 보상으로 증폭될 수 있다.
트러스트 리전(Trust Region)
정책 업데이트의 크기를 제한하여 최적화의 급격한 변화를 방지하는 기법으로, TOP-D에서는 내부 반복에서 중요도비와 clip 연산을 통해 오프라인 데이터를 안전하게 재사용하면서 단계별 최적화 오차를 줄인다.

코드 예제

text
0: Student π_θ, teacher π^*, dataset 𝒟_x, interpolation α, group size G, internal epochs E
1: while not converged do
2:   Initialize π_{θ_old} ← π_θ
3:   Sample a batch of prompts 𝒳 ⊂ 𝒟_x
4:   for each prompt x ∈ 𝒳 do
5:     Perform rollout to sample G responses {y^i}_{i=1}^G ∼ π_{θ_old}(·|x)
6:     Compute TOP-D rewards  r̃_k^i ← log(α π^*(y_k^i|x,y_{<k}^i)/π_{θ_old}(y_k^i|x,y_{<k}^i) + 1 − α)
7:     Compute token-level returns R̃_k^i ← r̃_k^i + 1/(|y^i| − k) ∑_{j=k+1}^{|y^i|} r̃_j^i
8:     Compute token-level advantages Â_k^i ← (R̃_k^i − μ)/σ
9:   end for
10:  for epoch e = 1 to E do
11:    J(θ) ← (1/∑_i |y^i|) ∑_{i=1}^G ∑_{t=1}^{|y^i|} min[p_t^i ⋅ Â_t^i, clip(p_t^i,1−ε,1+ε) ⋅ Â_t^i]
12:    Update θ by maximizing J(θ)
13:  end for
14: end while

이 코드는 TOP-D의 학습 루프와 근접 교사 보상 계산, 토큰 수준 반환 및 내부 trust region 반복으로 정책을 업데이트하는 핵심 절차를 의사코드 형태로 요약한다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 06.수집 2026. 07. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.