TL;DR
확산형 언어 모델은 병렬적이고 양방향 문맥을 활용하는 장점이 있으나 학습 후 추론 능력, 특히 수학적 추론을 강화하는 데 표준적인 SFT와 RL 접근법이 잘 통하지 않았다. dOPSD는 외부 정답이나 보상 모델 없이 모델 자신이 생성한 디노이징 궤적의 후속 단계들을 교사의 '특권'으로 삼아 밀도 높은 토큰 수준 신호를 제공하므로 레이블 효율적으로 성능을 끌어올린다. 이 방식은 확산형 디코딩에서만 존재하는 내부 정보의 계층성을 활용하여 기존 OPSD의 인스턴스-특정 PI 의존 문제를 회피한다.
왜 중요한가
확산형 언어 모델은 병렬적이고 양방향 문맥을 활용하는 장점이 있으나 학습 후 추론 능력, 특히 수학적 추론을 강화하는 데 표준적인 SFT와 RL 접근법이 잘 통하지 않았다. dOPSD는 외부 정답이나 보상 모델 없이 모델 자신이 생성한 디노이징 궤적의 후속 단계들을 교사의 '특권'으로 삼아 밀도 높은 토큰 수준 신호를 제공하므로 레이블 효율적으로 성능을 끌어올린다. 이 방식은 확산형 디코딩에서만 존재하는 내부 정보의 계층성을 활용하여 기존 OPSD의 인스턴스-특정 PI 의존 문제를 회피한다.
핵심 기여
확산형 디코더에서 OPSD의 실패 원인 규명
본 논문은 OPSD가 확산형 언어 모델에 직접 적용될 때 외부 레퍼런스 기반의 특권 정보가 테스트 시 학생이 접근할 수 없어 PI-평균화된 약한 정책으로 수렴함을 수학적으로 제시했다. 또한 무작위 리마스킹이 모델의 실제 디코딩 경로에서 벗어나 감독 신호의 분포를 크게 왜곡함을 실험으로 확인했다. 이 분석은 확산 디코더의 고유한 디노이징 궤적 특성이 문제의 핵심임을 분명히 했다.
디노이징 궤적에서 특권을 추출하는 dOPSD 제안
dOPSD는 학생의 중간 디코딩 스텝을 평가하면서 동일 모델의 이후 단계들에서 같은 마스크 위치에 대한 예측을 평균하여 교사 타깃을 구성하는 방법을 도입했다. 이 교사 타깃은 외부 참답안을 사용하지 않고 온-폴리시이며 토큰 수준의 밀도 높은 신호를 제공한다. 또한 잘못된 롤아웃은 검증기로 배제하여 오답 증폭을 방지하는 실용적 절차를 포함했다.
다양한 비교 대상과 데이터셋에서의 일관된 성능 개선 증명
Dream-7B-Instruct와 LLaDA-8B-Instruct 기반에서 dOPSD는 GSM8K, MATH500 같은 인-도메인 수학 벤치마크와 HumanEval, MBPP 같은 도메인 외 코드 생성에서 모두 베이스 모델 대비 향상을 달성했다. 특히 Dream에서 GSM8K는 81.41에서 83.04로, MATH500은 38.97에서 42.20으로 상승하는 등 수치적 개선이 확인되었다. 반면 SFT, RL 기반 방법, OPSD의 단순 이식 버전들은 대체로 성능 정체 또는 악화를 보였다.
교사 호라이즌, 마스크 임계치, 발산 방향에 대한 체계적 절차
교사 타깃을 구성할 때 뒤따르는 전체 남은 궤적을 평균하는 것이 성능에 유리함이 실험적으로 확인되었고, 학생 평가 스텝의 마스크 비율 임계치 tau=0.5가 경험적으로 최적이었다. 또한 JSD의 두 극한인 forward KL(β→0)와 reverse KL(β→1)를 비교한 결과 forward KL이 전반적으로 더 우수하여 기본 설정으로 채택되었다. 이들 하이퍼파라미터 분석은 방법의 안정성과 일반화 성능에 직접 관련되었다.
핵심 아이디어 이해하기
출발점은 확산형 언어 모델의 디코딩이 단계별로 마스크된 위치를 점진적으로 복원하면서 최종 텍스트를 만드는 디노이징 궤적을 생성한다는 점이다. 각 중간 상태는 모델에게 서로 다른 정보량을 제공하며 뒤쪽 단계에서는 앞 단계보다 더 많은 주변 토큰이 커밋되어 특정 마스크된 위치에 대해 더 정확한 예측이 가능하다. OPSD는 온-폴리시 토큰 수준 신호를 활용하려 했지만 그 특권이 외부 참답안에 기반하면 테스트 시 학생이 접근할 수 없어 평균화로 약화되는 한계를 갖는다.
관련 Figure

그래프는 완성된 롤아웃에서 균등 무작위 마스크를 취하면 많은 마스크 위치가 모델이 이미 커밋했을 '쉬운' 토큰들에 해당함을 수치적으로 보여준다. 이로 인해 무작위 마스크 기반의 OPSD 포팅이 디코딩 경로에서 벗어난 감독 신호를 만들어 학습 성능을 저하시킨다는 본 논문의 주장에 실증적 근거를 제공한다. 반면 온-폴리시 마스크(디코딩 스텝에서의 마스크)는 본래 경로를 따르므로 오프-패스 분율이 0으로 유지된다.
무작위 마스크가 모델의 실제 디코딩 프런티어에서 벗어나는 정도(오프-패스 분율)를 마스크 비율 p에 대해 플롯한 그래프이다.
방법론
dOPSD의 핵심은 학생의 중간 디코딩 스텝을 학생 상태로 삼고 동일한 모델의 이후 디코딩 스텝들을 교사 특권의 원천으로 삼는 것이다. 구체적으로 학생은 마스크 비율이 임계치 τ 이상인 스텝 k에서의 마스크 집합 M_k에 대해 예측을 수행하고, 교사는 각 마스크 위치 i에 대해 그 위치가 여전히 마스크된 이후의 모든 스텝 T_i에서의 예측 분포들을 평균하여 타깃 확률 \bar{p}_i를 만든다. 이 평균은 i가 이미 커밋되어 단순 복사가 되는 스텝은 제외하므로 교사의 정보 이득은 오직 진짜 peek-ahead에서만 발생한다.
관련 Figure

이 그림은 동일한 모델이 학생과 교사 역할을 모두 수행하는 점과 교사 타깃이 외부 레퍼런스가 아니라 학생의 후속 디코딩 상태들에서 파생됨을 시각적으로 드러낸다. 그림의 오른쪽에는 손실에 그라디언트가 흐르는 방향이 학생에게만 적용됨을 표기하여 교사 타깃에 대한 stop-gradient 처리가 이루어짐을 보여준다. 또한 롤아웃 검증기가 최종 정답과 일치하는 경우에만 손실을 계산하도록 필터링하는 절차가 포함되어 있음을 명확히 나타낸다.
dOPSD의 전체 학습 파이프라인 도식으로 학생의 롤아웃 생성, 중간 스텝에서의 학생 평가, 이후 스텝들의 평균화로 교사 타깃을 구성하는 흐름을 나타낸다.

이 도식은 식(6)의 p_bar_i = (1/|T_i|) sum_{t in T_i} π_θ(·|x,s_t)_i 수식이 실제로 어떻게 적용되는지 단계별로 시각화한다. 특히 커밋된 스텝에서는 모델이 단순 복사만 하므로 그 스텝들을 제외하는 이유를 직관적으로 전달하며, 평균화가 위치의 남은 '예측 가능성' 전구간을 집계함을 강조한다. 이 시각적 설명은 교사 호라이즌을 넓히는 것이 정보량을 늘리고 성능 개선으로 이어진다는 실험적 발견과 직접 연결된다.
교사 타깃 구성 방식의 상세 도식으로, 각 마스크 위치에 대해 이후 스텝들에서의 예측을 계속 평균하다가 해당 위치가 커밋되면 평균에서 제외하는 과정을 보여준다.

곡선은 무작위 마스크 토큰을 기준으로 학생을 점수화하면 시간이 지남에 따라 정확도가 떨어지는 반면, 진짜 디코드 스텝에서 점수화하면 정확도가 안정적으로 유지되거나 향상됨을 나타낸다. 이 결과는 무작위 리마스킹이 학습 신호의 분포를 왜곡하여 성능 저하를 초래한다는 방법론적 근거를 제공한다. 따라서 dOPSD가 중간 스텝을 직접 샘플링하는 설계가 실험적으로 유의미함이 확인된다.
dOPSD에서 무작위로 선택한 디코드 스텝과 무작위 마스크 토큰을 비교하면서 학습 중 GSM8K 정확도 변화를 보여주는 학습 곡선이다.
주요 결과
주요 실험에서 dOPSD는 Dream-7B-Instruct와 LLaDA-8B-Instruct 양쪽에서 베이스 모델을 일관되게 능가했다. Dream에서는 GSM8K가 81.41에서 83.04로, MATH500이 38.97에서 42.20으로 상승했으며 HumanEval과 MBPP도 각각 52.54→56.71, 57.43→58.49로 개선되었다. LLaDA에서도 GSM8K는 71.23에서 72.87로, MATH500은 31.24에서 36.00으로 향상되어 수학적 추론뿐 아니라 수학만으로 학습했음에도 코드 생성의 도메인 외 일반화 성능까지 개선된 점이 확인되었다.
관련 Figure

이 그림들은 forward KL(β→0)이 reverse KL보다 모든 벤치마크에서 우수했고 교사가 더 먼 미래 스텝까지 평균할수록 성능이 향상된다는 실험적 사실을 보여준다. 또한 마스크 임계치 τ 값에 따라 최적 성능이 τ=0.5 근처에 존재함이 관찰되어 중간 정도의 마스크 잔여량이 학습 신호로서 가장 유효함을 시사한다. 이들 결과는 논문이 채택한 기본 설정들의 실험적 정당성을 뒷받침한다.
dOPSD의 주요 하이퍼파라미터(교사 호라이즌, 마스크 임계치, JSD 방향 등)에 대한 Ablation 결과를 담은 여러 플롯이다.

이 플롯은 검증기 없이 모든 롤아웃에서 증류하는 경우에도 베이스 모델 대비 개선이 관찰되며, 정답 검증을 추가하면 추가적인 향상이 발생한다는 실험적 사실을 시각화한다. 각 벤치마크에 대한 점수 이동이 선으로 연결되어 있어 방법별 성능 변화 양상이 직관적으로 드러난다. 이 그림은 dOPSD의 핵심 개선이 궤적 기반 특권 신호 자체에서 비롯되며 검증은 보완적 역할을 한다는 결론을 보강한다.
베이스 모델, 검증 없이 학습한 경우, dOPSD를 적용한 경우를 나란히 비교한 성능 점수 분포 플롯으로 네 가지 벤치마크 점수를 한눈에 보여준다.

이 요약 막대그래프는 dOPSD가 대부분의 벤치마크에서 최상위 성능을 달성했음을 한눈에 보여주며 OPSD(전체 해답) 포트가 대체로 성능 하락을 보였음을 강조한다. 수치 레이블이 각 막대에 표시되어 있어 베이스 대비 증감량을 직접 확인할 수 있다. 시각적 비교는 논문의 주장, 즉 궤적 기반 특권 추출이 확산형 모델에서 실효성 있는 해결책이라는 점을 명확히 뒷받침한다.
주요 비교 실험의 요약 막대그래프로 Dream과 LLaDA에서 베이스와 dOPSD, 기타 방법들의 벤치마크 점수를 비교하고 있다.
기술 상세
전체 아키텍처는 기존의 확산형 디코더를 변경하지 않으며 학생과 교사가 동일한 파라미터 θ를 공유한다. 학습 과정에서는 학생이 중간 스텝 s_k에서 마스크된 위치 M_k에 대해 π_θ(·|x,s_k)_i를 출력하고 교사는 각 i에 대해 이후 남은 스텝 t∈T_i에서의 π_θ(·|x,s_t)_i를 평균하여 \bar{p}_i를 구성한다. 손실 함수는 교사 타깃에 대해 gradient flow를 차단하고 학생 측에 generalized Jensen–Shannon divergence JSD_β(sg[\bar{p}_i] || π_θ(·|x,s_k)_i)를 적용하며 기본적으로 forward KL(β→0) 방향을 사용했다.
한계점
dOPSD는 확산형 디코더가 생성하는 명확한 디노이징 궤적이 존재해야 동작하므로 좌-투-우(autoregressive) 모델에는 본질적으로 적용될 수 없다. 또한 교사 타깃을 구성하기 위해 학생의 후속 스텝들에 대한 추가 전방향(forward) 연산을 수행하므로 계산 비용과 메모리 부담이 늘어나며 이 비용은 궤적의 길이와 평균에 포함되는 스텝 수에 비례한다. 논문은 롤아웃 검증을 통해 오답 증폭을 완화하는 절차를 제시했으나, 검증 레이블이 없는 환경에서는 검증 없이도 개선이 관찰되지만 검증이 존재할 때보다 성능이 약간 낮아질 수 있다.
실무 활용
dOPSD는 외부 정답 레퍼런스가 불완전하거나 존재하지 않는 데이터셋에서도 적용 가능한 온-폴리시 후처리 방법으로 실무에서 기존 SFT나 RL보다 라벨 효율적인 성능 향상을 제공할 가능성이 있다. 구현 관점에서 추가 비용은 학생이 롤아웃을 생성한 뒤 남은 궤적의 각 유효 스텝에 대해 교사 forward를 더 수행하는 점에 국한된다. 공개된 구현(https://github.com/tuandattt/dOPSD)은 논문에 제시된 LoRA 설정과 훈련 하이퍼파라미터를 포함하므로 실무 도입이 용이하다.
- 대규모 레이블이 부족한 상황에서 확산형 LLM을 후처리하여 수학적 추론 성능을 향상시키는 파이프라인에 적용할 수 있다.
- 모델을 특정 도메인(예: 코드 생성)에 직접 재학습시키기 어렵거나 레이블이 제한적일 때 dOPSD로 온-폴리시 신호를 이용해 일반화를 개선할 수 있다.
- 데이터셋에 레퍼런스 정답이 없는 생성 문제에서 검증기 없이도 자체 궤적을 이용해 자기-증류를 수행하는 데 활용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
추가 이미지 분석

막대그래프는 모든 벤치마크에서 forward KL(보라색 막대)이 reverse KL(초록색 막대)보다 높음을 수치로 보여주며, 특히 HumanEval과 MBPP 같은 코드 벤치마크에서 forward KL 우위가 뚜렷하다. 이는 교사 분포의 전체 질량을 복제하려는 forward KL이 궤적에서 얻은 특권 신호를 더 잘 보존한다는 논문의 주장을 지지한다. 그래프에는 각 수치가 명시되어 있어 정량적 비교가 용이하다.
Dream-7B-Instruct와 LLaDA-8B-Instruct에서 Reverse KL과 Forward KL을 비교한 바 차트로 각 벤치마크별 점수를 제시하고 있다.
용어 해설
- Diffusion Language Model
- — 확산형 언어 모델은 초기에는 전체 시퀀스를 마스크 상태로 두고 반복적 디노이징 과정을 통해 마스크된 위치들을 점진적으로 예측·커밋하여 최종 텍스트를 생성하는 모델 계열이다. 각 디코딩 스텝에서 모델은 아직 마스크된 토큰들에 대한 확률분포를 예측하고 가장 확신하는 토큰을 고정하여 다음 스텝의 컨텍스트로 반영한다. 이 방식은 병렬 디코딩과 양방향 문맥 활용을 가능하게 하며 본 논문에서는 해당 디노이징 궤적을 자기-증류의 'privileged' 신호로 활용한다.
- On-Policy Self-Distillation
- — 온-폴리시 자기 증류는 동일한 모델이 학생 역할과 교사 역할을 동시에 수행하되 교사는 학생의 온-폴리시 생성물(학생이 실제 생성한 롤아웃)에 대해 보다 정보가 많은 문맥을 갖고 토큰 수준의 소프트 타깃을 제공하여 학생을 학습시키는 방법이다. 전통적 지식증류와 달리 외부의 더 큰 교사를 필요로 하지 않으며 학생의 실제 분포에서 발생하는 상태들만을 대상으로 한다. 본 논문은 이 아이디어를 확산형 디코더에 맞춰 학생 자신의 디노이징 궤적에서 교사의 특권을 추출하도록 변경했다.
- Privileged Information
- — 특권 정보는 교사 역할이 학습 시에만 접근 가능한 추가적 문맥으로서, 보통 훈련 중에만 제공되는 참답안이나 체인오브생각 같은 인스턴스-특정 레퍼런스를 의미한다. 해당 정보는 교사를 강하게 만들지만 테스트 시 학생이 해당 정보를 얻을 수 없으면 학생은 그 정보의 마지널화된 약한 정책으로 수렴할 위험이 있다. dOPSD는 외부 레퍼런스 대신 학생 자신의 디노이징 궤적에서 특권을 획득하여 이 문제를 해결한다.
- Denoising Trajectory
- — 디노이징 궤적은 확산형 디코더가 완전 마스크 상태에서 시작해 단계별로 일부 토큰을 복원·커밋하며 최종 완성 토큰을 얻기까지 생성하는 일련의 중간 상태들의 순서를 말한다. 각 중간 상태는 아직 마스크된 위치들(M_k)과 이미 확정된 토큰들로 이루어져 있으며 뒤쪽 단계일수록 더 많은 토큰이 커밋되어 정보량이 증가한다. 본 논문은 같은 모델의 서로 다른 궤적 단계들을 교사·학생 간 특권 차원으로 활용한다.
코드 예제
Algorithm 1 dOPSD Training
Require: dataset S = {(x_i, a_i)}_{i=1}^N with final answers a_i; diffusion LM pi_theta; mask threshold tau
1: while not converged do
2: Sample a minibatch B subset S
3: for all (x,a) in B do
4: Roll out y_hat with its trajectory (s_0,...,s_K) ~ pi_theta(.|x)
5: if y_hat disagrees with gold answer a then
6: l(x) <- 0 {discard wrong rollout}
7: else
8: Sample step k uniformly from {k': |M_{k'}|/L > tau}
9: Build teacher targets {p_bar_i}_{i in M_k} over remaining masked steps
10: Score M_k via Eq.(7) to obtain l(x)
11: end if
12: end for
13: L_dOPSD <- (1/|B|) sum_{(x,a) in B} l(x); update theta
14: end while이 코드는 dOPSD의 학습 루프를 단계별로 구현한 의사 코드로서 배치별로 모델의 온-폴리시 롤아웃을 생성하고 정답 검증을 거쳐 중간 디코딩 스텝에서 학생을 평가하며 동일 모델의 후속 스텝 예측들을 평균하여 교사 타깃을 구성하는 과정을 포함한다. 알고리즘은 잘못된 롤아웃을 폐기하고 지정된 마스크 임계치 tau 이상인 스텝에서만 손실을 계산하여 안정성을 확보한다. 이 의사 코드는 실제 구현에서 teacher forward를 추가 수행하는 비용이 발생함을 분명히 보여준다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
