용어 해설
- 근접 교사 분포(Proximal Teacher)
- — 교사 모델과 현재 학생 정책의 확률을 α로 보간하여 만든 대체 확률분포로서, 로그 확률비를 직접 사용하지 않고 αρ + 1 − α 형태의 보상을 계산해 로그 보상의 하한을 보장함으로써 극단적 음의 보상으로 인한 분산 폭주를 막는다.
- 중요도 샘플링(Importance Sampling)
- — 행동 중요도 비율 p_t = π_θ(y_t|·)/π_{θ_old}(y_t|·)을 통해 다른 정책으로 생성된 토큰을 재사용하여 손실을 추정하는 기법으로, TOP-D에서는 내부 trust region 반복에서 오프라인 롤아웃을 재활용해 샘플 효율을 높인다.
- 토큰 수준 이점 정규화(Token-level Advantage Normalization)
- — 동일 프롬프트에 대해 생성된 여러 응답의 토큰별 반환값을 그룹 단위로 평균과 표준편차로 정규화하여 토큰 수준의 이점을 계산함으로써 길이 편향을 줄이고 조밀한 보상 신호를 더 잘 활용하는 정규화 절차이다.
- 역 KL 발산(Reverse KL)
- — 학생 분포 π_θ를 교사 분포 π^*에 근사시키기 위해 사용되는 불평등성으로, OPD에서는 기대 로그비(log π^*/π_θ)를 최대화하는 형태로 학습 목표가 정의되어 교사-학생 확률 불일치가 로그 보상으로 증폭될 수 있다.
- 트러스트 리전(Trust Region)
- — 정책 업데이트의 크기를 제한하여 최적화의 급격한 변화를 방지하는 기법으로, TOP-D에서는 내부 반복에서 중요도비와 clip 연산을 통해 오프라인 데이터를 안전하게 재사용하면서 단계별 최적화 오차를 줄인다.
코드 예제
0: Student π_θ, teacher π^*, dataset 𝒟_x, interpolation α, group size G, internal epochs E
1: while not converged do
2: Initialize π_{θ_old} ← π_θ
3: Sample a batch of prompts 𝒳 ⊂ 𝒟_x
4: for each prompt x ∈ 𝒳 do
5: Perform rollout to sample G responses {y^i}_{i=1}^G ∼ π_{θ_old}(·|x)
6: Compute TOP-D rewards r̃_k^i ← log(α π^*(y_k^i|x,y_{<k}^i)/π_{θ_old}(y_k^i|x,y_{<k}^i) + 1 − α)
7: Compute token-level returns R̃_k^i ← r̃_k^i + 1/(|y^i| − k) ∑_{j=k+1}^{|y^i|} r̃_j^i
8: Compute token-level advantages Â_k^i ← (R̃_k^i − μ)/σ
9: end for
10: for epoch e = 1 to E do
11: J(θ) ← (1/∑_i |y^i|) ∑_{i=1}^G ∑_{t=1}^{|y^i|} min[p_t^i ⋅ Â_t^i, clip(p_t^i,1−ε,1+ε) ⋅ Â_t^i]
12: Update θ by maximizing J(θ)
13: end for
14: end while이 코드는 TOP-D의 학습 루프와 근접 교사 보상 계산, 토큰 수준 반환 및 내부 trust region 반복으로 정책을 업데이트하는 핵심 절차를 의사코드 형태로 요약한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.