추가 이미지 분석

막대그래프는 모든 벤치마크에서 forward KL(보라색 막대)이 reverse KL(초록색 막대)보다 높음을 수치로 보여주며, 특히 HumanEval과 MBPP 같은 코드 벤치마크에서 forward KL 우위가 뚜렷하다. 이는 교사 분포의 전체 질량을 복제하려는 forward KL이 궤적에서 얻은 특권 신호를 더 잘 보존한다는 논문의 주장을 지지한다. 그래프에는 각 수치가 명시되어 있어 정량적 비교가 용이하다.
Dream-7B-Instruct와 LLaDA-8B-Instruct에서 Reverse KL과 Forward KL을 비교한 바 차트로 각 벤치마크별 점수를 제시하고 있다.
용어 해설
- 확산형 언어 모델(Diffusion Language Model)
- — 확산형 언어 모델은 초기에는 전체 시퀀스를 마스크 상태로 두고 반복적 디노이징 과정을 통해 마스크된 위치들을 점진적으로 예측·커밋하여 최종 텍스트를 생성하는 모델 계열이다. 각 디코딩 스텝에서 모델은 아직 마스크된 토큰들에 대한 확률분포를 예측하고 가장 확신하는 토큰을 고정하여 다음 스텝의 컨텍스트로 반영한다. 이 방식은 병렬 디코딩과 양방향 문맥 활용을 가능하게 하며 본 논문에서는 해당 디노이징 궤적을 자기-증류의 'privileged' 신호로 활용한다.
- 온-폴리시 자기 증류(On-Policy Self-Distillation)
- — 온-폴리시 자기 증류는 동일한 모델이 학생 역할과 교사 역할을 동시에 수행하되 교사는 학생의 온-폴리시 생성물(학생이 실제 생성한 롤아웃)에 대해 보다 정보가 많은 문맥을 갖고 토큰 수준의 소프트 타깃을 제공하여 학생을 학습시키는 방법이다. 전통적 지식증류와 달리 외부의 더 큰 교사를 필요로 하지 않으며 학생의 실제 분포에서 발생하는 상태들만을 대상으로 한다. 본 논문은 이 아이디어를 확산형 디코더에 맞춰 학생 자신의 디노이징 궤적에서 교사의 특권을 추출하도록 변경했다.
- 특권 정보(Privileged Information)
- — 특권 정보는 교사 역할이 학습 시에만 접근 가능한 추가적 문맥으로서, 보통 훈련 중에만 제공되는 참답안이나 체인오브생각 같은 인스턴스-특정 레퍼런스를 의미한다. 해당 정보는 교사를 강하게 만들지만 테스트 시 학생이 해당 정보를 얻을 수 없으면 학생은 그 정보의 마지널화된 약한 정책으로 수렴할 위험이 있다. dOPSD는 외부 레퍼런스 대신 학생 자신의 디노이징 궤적에서 특권을 획득하여 이 문제를 해결한다.
- 디노이징 궤적(Denoising Trajectory)
- — 디노이징 궤적은 확산형 디코더가 완전 마스크 상태에서 시작해 단계별로 일부 토큰을 복원·커밋하며 최종 완성 토큰을 얻기까지 생성하는 일련의 중간 상태들의 순서를 말한다. 각 중간 상태는 아직 마스크된 위치들(M_k)과 이미 확정된 토큰들로 이루어져 있으며 뒤쪽 단계일수록 더 많은 토큰이 커밋되어 정보량이 증가한다. 본 논문은 같은 모델의 서로 다른 궤적 단계들을 교사·학생 간 특권 차원으로 활용한다.
코드 예제
Algorithm 1 dOPSD Training
Require: dataset S = {(x_i, a_i)}_{i=1}^N with final answers a_i; diffusion LM pi_theta; mask threshold tau
1: while not converged do
2: Sample a minibatch B subset S
3: for all (x,a) in B do
4: Roll out y_hat with its trajectory (s_0,...,s_K) ~ pi_theta(.|x)
5: if y_hat disagrees with gold answer a then
6: l(x) <- 0 {discard wrong rollout}
7: else
8: Sample step k uniformly from {k': |M_{k'}|/L > tau}
9: Build teacher targets {p_bar_i}_{i in M_k} over remaining masked steps
10: Score M_k via Eq.(7) to obtain l(x)
11: end if
12: end for
13: L_dOPSD <- (1/|B|) sum_{(x,a) in B} l(x); update theta
14: end while이 코드는 dOPSD의 학습 루프를 단계별로 구현한 의사 코드로서 배치별로 모델의 온-폴리시 롤아웃을 생성하고 정답 검증을 거쳐 중간 디코딩 스텝에서 학생을 평가하며 동일 모델의 후속 스텝 예측들을 평균하여 교사 타깃을 구성하는 과정을 포함한다. 알고리즘은 잘못된 롤아웃을 폐기하고 지정된 마스크 임계치 tau 이상인 스텝에서만 손실을 계산하여 안정성을 확보한다. 이 의사 코드는 실제 구현에서 teacher forward를 추가 수행하는 비용이 발생함을 분명히 보여준다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.








