TL;DR
온-정책 증류는 학생이 생성한 토큰 궤적에 대해 교사가 토큰 단위로 촘촘한 감독 신호를 제공해 분포 불일치 문제를 완화하며 효율적인 능력 전이를 가능하게 한다. 그러나 특권 입력을 도입하면 교사와 학생 간 정보 비대칭 때문에 학생이 실제 전이 가능한 능력 대신 특권에 의존한 출력을 모방하는 특권 환상이 발생할 위험이 높아진다. DOPD는 토큰별로 교사와 학생의 특권 우위 격차와 예측 확률을 계산해 감독 원천과 강도를 동적으로 분배함으로써 전이 가능한 신호만 선택적으로 전달하고 훈련 안정성을 유지했다.
왜 중요한가
온-정책 증류는 학생이 생성한 토큰 궤적에 대해 교사가 토큰 단위로 촘촘한 감독 신호를 제공해 분포 불일치 문제를 완화하며 효율적인 능력 전이를 가능하게 한다. 그러나 특권 입력을 도입하면 교사와 학생 간 정보 비대칭 때문에 학생이 실제 전이 가능한 능력 대신 특권에 의존한 출력을 모방하는 특권 환상이 발생할 위험이 높아진다. DOPD는 토큰별로 교사와 학생의 특권 우위 격차와 예측 확률을 계산해 감독 원천과 강도를 동적으로 분배함으로써 전이 가능한 신호만 선택적으로 전달하고 훈련 안정성을 유지했다.
핵심 기여
Privilege advantage gap에 기반한 토큰 단위 분류
동일한 특권 입력을 준 상태에서 교사와 학생의 토큰별 로그확률 차이의 절대값을 privilege advantage gap으로 정의했다. 이 지표는 토큰이 진짜 능력 신호를 담고 있는지 아니면 특권 의존 신호인지 가늠하는 실용적 근거로 사용되었다. 논문은 이 값과 두 정책의 예측 확률을 병합해 토큰을 네 가지 범주로 분류한 뒤 각 범주에 맞는 감독 전략을 적용했다.
Advantage-aware dual distillation 프레임워크 제안
교사 기반 전이와 학생 자기정규화 신호를 토큰 수준에서 동적으로 라우팅하는 DOPD를 설계했다. 각 토큰에 대해 특권 교사·특권 학생의 추가 순전파를 통해 q_T, q_S, ℓ_T, ℓ_S를 계산하고 정규화한 뒤 4개 규칙(LH, LL, HT, HS)에 따라 Top-K reverse KL, full-vocabulary JS, 또는 privileged-student 기반 약한 정규화를 선택적으로 적용했다. 이 절차는 특권 환상을 완화하면서 핵심 능력 토큰에는 강한 전이를, 불확실 토큰에는 보수적 규제를 부과하도록 구성되었다.
LLM 및 VLM 환경에서 광범위한 실험 검증
Qwen3 및 Qwen3-VL 계열 모델 페어를 사용해 LLM 기반과 VLM 기반 OPD 설정에서 평가를 수행했다. 평균 지표에서 DOPD는 Vanilla OPD 대비 LLM 기반에서 7.5점, VLM 기반에서 6.0점의 절대 성능 향상을 보였고 다수의 벤치마크와 모델 크기 쌍에서 일관된 개선을 보였다. 추가로 연속 학습, 도메인 밖 일반화, 안정성·엔트로피 경향, 민감도·소거(ablation) 실험을 통해 설계 타당성이 입증되었다.
토큰-레벨 소거 실험으로 중요성 검증
토큰 중 우위 격차가 큰 토큰을 제거하면 성능이 크게 하락하는 반면, 우위 격차가 작은 토큰이나 무작위 토큰 제거는 영향이 작다는 결과를 보고했다. 이 관찰은 privilege advantage gap이 능력 중심 토큰을 가려내는 유효한 지표임을 실험적으로 뒷받침했다. 또한 네 가지 토큰 유형을 균등하게 처리하는 기존 방식보다 적응적 라우팅을 적용했을 때 전체 성능과 안정성에서 유의한 이득이 확인되었다.
핵심 아이디어 이해하기
온-정책 증류는 학생 정책으로부터 직접 샘플된 토큰 궤적에 대해 교사가 토큰 단위 확률 분포를 제공함으로써 분포 불일치 문제를 완화하고 촘촘한 감독을 통해 전이 효율을 높인다. 그러나 특권 입력을 교사나 학생에 추가하면 교사의 향상된 예측이 실제로는 특권 정보의 단순 활용에서 비롯될 수 있으므로 학생이 학습해야 할 내재적 능력과 정보 비대칭으로 인한 단기적 이득이 혼재한다. 이 혼재 현상이 특권 환상(privilege illusion)이다.
특권 환상을 피하려면 어떤 토큰이 진짜 전이 가능한 능력 신호를 포함하는지를 식별해야 한다. 논문은 특권 입력을 준 상태에서 교사와 학생의 로그확률 차이의 절대값을 privilege advantage gap으로 계산하고, 이 값이 크면 교사가 학생보다 진짜로 우수한 예측 경향을 가진 것으로 해석한다. 반대로 격차가 작으면 교사와 학생이 특권에 대해 유사하게 반응하거나 둘 다 불확실한 영역으로 판단할 수 있다.
이 정보를 이용해 토큰별로 감독원천과 손실 형태를 달리하면 불필요한 모방을 줄이면서 핵심 능력은 집중적으로 전이할 수 있다. 구체적으로 우위 격차가 크고 교사 확률이 높은 경우에는 full-vocabulary JS로 강한 전이를 수행하고, 우위 격차가 작고 양쪽 확률이 높은 경우에는 Top-K reverse KL로 보수적 전이를 적용한다. 이처럼 토큰 수준에서 신호의 출처와 강도를 달리하면 특권 환상을 완화하고 학습 안정성을 확보할 수 있다.
관련 Figure

고우위 토큰을 제거하면 성능이 크게 떨어져 해당 토큰들이 전이 핵심임이 드러났다. 반면 무작위 토큰이나 저우위 토큰 제거는 성능에 거의 영향을 주지 않아 우위 격차가 능력 중심 토큰 식별에 유효함이 확인되었다. 이 실험은 privilege advantage gap의 유효성을 실험적으로 입증하는 근거로 사용되었다.
토큰 소거(ablation) 실험 결과를 단계별로 제시한 그래프로서 고·저 우위 토큰 제거의 성능 영향을 비교하고 있다.

그림은 low-gap/high-prob 등 네 가지 범주가 실제 문장 내에서 서로 다른 역할을 하는 패턴을 시각화해 준다. 고우위 교사 우세 토큰은 주로 결정적 근거를 포함하는 반면 저우위 토큰은 연결어·전환부 등 정보량이 적은 부분에 해당하는 경향이 관찰되었다. 이 시각화는 제안한 토큰 분류 기준이 의미론적·기능적 차이를 반영함을 보여 준다.
토큰별 시각화로서 실제 생성 궤적 내에서 네 가지 토큰 유형의 분포를 색상으로 표시한 그림이다.
방법론
전체 접근은 학생 정책으로부터 온-정책 샘플을 생성한 뒤 각 샘플 토큰에 대해 특권 입력을 포함한 추가 순전파를 두 번 수행하는 것이다. 첫 번째 순전파는 특권을 포함한 학생 정책(privileged student)이고 두 번째는 특권을 포함한 교사 정책(privileged teacher)이다. 두 분포에서 해당 토큰의 확률 q_S, q_T와 로그확률 ℓ_S, ℓ_T를 산출한 뒤 그 차이의 절대값을 privilege advantage gap A로 정의한다.
배치 내 안정성을 위해 A 및 확률값들의 평균을 구할 때 상위 5% 이상치 제거와 정규화를 적용한다. 각 토큰은 A와 q_S+q_T의 상대값에 따라 네 가지 규칙(LH, LL, HT, HS) 중 하나로 분류된다. LH는 낮은 A와 높은 확률의 케이스로 보수적 교사 전이(Top-K reverse KL)를 적용하고 LL은 낮은 A와 낮은 확률의 케이스로 privileged-student 기반의 약한 정규화를 적용한다.
HT는 큰 A와 교사 확률이 높을 때 full-vocabulary JS를 단위 가중치로 적용해 풍부한 분포 정보를 전이한다. HS는 큰 A이지만 학생 확률이 높을 때 privileged student를 목표로 하는 Top-K reverse KL를 가벼운 강도로 적용해 학생의 탐색을 억제하지 않도록 구성한다. 최종 손실은 네 가지 토큰별 손실을 마스크로 합산한 형태이며 배치 평균을 취해 파라미터를 갱신한다.
구현상 세부값은 Top-K는 K=128을 사용하고, 약한 정규화와 가벼운 전이의 강도 계수는 각각 β_w=0.3, β_l=0.6으로 설정되었다. 교사는 훈련 중 고정(frozen) 상태이며 학생만 AdamW로 최적화하고 cosine 스케줄러를 사용했다. LLM 실험은 배치 크기 128, VLM은 배치 크기 64, 각각 4개의 롤아웃 샘플을 사용하고 최대 200~300 스텝으로 훈련을 진행했다.
관련 Figure

다이어그램은 학습 루프의 데이터 흐름을 명확히 나타내어 privileged student와 privileged teacher의 추가 순전파가 어떻게 토큰별 손실 형태 선택으로 연결되는지를 구조적으로 보여준다. 각 라우팅 케이스에 대응하는 손실 함수(JS, Top-K reverse KL 등)와 stop-gradient 처리 위치가 시각적으로 표시되어 구현상 핵심 포인트를 빠르게 파악할 수 있다. 이 그림은 방법의 작동 원리를 직관적으로 보강하는 핵심 자료이다.
방법 개요 다이어그램으로서 온-정책 샘플링, privileged forward pass, privilege advantage gap 계산, 그리고 네 가지 토큰별 라우팅 경로를 도식화한 그림이다.
주요 결과
주요 결과에서 DOPD는 LLM 기반 설정에서 Vanilla OPD 대비 평균 7.5점의 절대 성능 향상을 달성했으며 VLM 기반 설정에서는 평균 6.0점 향상을 보였다. 다수의 벤치마크별로 보면 DOPD는 reasoning과 coding 계열에서 특히 큰 개선을 보였고 몇몇 어려운 벤치마크에서는 학생이 교사 성능에 근접하거나 초과하는 결과를 얻었다. 또한 다섯 개의 서로 다른 교사-학생 모델 페어에 걸쳐 DOPD는 일관되게 Vanilla OPD를 크게 상회해 모델 규모 차이가 커질 때도 성능 이득이 유지되었다.
안정성 측면에서 DOPD는 학습 초중반부터 더 빠르게 성능을 끌어올렸고 엔트로피 추이가 급격히 붕괴하지 않아 건전한 탐색-수렴 패턴을 보였다. 연속 학습 시나리오에서는 새로운 도메인을 순차적으로 학습할 때 이전 도메인의 성능 유지가 우수해 파라미터 덮어쓰기에 의한 망각이 적었다. 도메인 밖 일반화 실험에서도 DOPD는 다른 데이터 영역으로의 전이 성능에서 대표적 기준 방법들보다 3~4점 이상 우수한 결과를 보였다.
설계 구성요소의 기여를 보인 소거 실험에서 특권 입력은 본 방법의 핵심 기반으로 확인되었고, 교사와 학생 양쪽 신호를 적절히 조합하는 적응적 라우팅이 전체 성능 향상과 학습 안정성에 결정적 영향을 미쳤다. 또한 토큰 단위로 우위 격차가 큰 토큰을 중점적으로 정합했을 때 성능이 크게 저하됨을 통해 해당 토큰들이 전이 핵심임이 수치적으로 확인되었다.
관련 Figure

그림은 LLM 기반과 VLM 기반 설정에서 DOPD가 Vanilla OPD와 기존 변형들을 상회하며 평균 성능 우위를 유지함을 수치적으로 보여준다. 개별 벤치마크 막대는 DOPD가 reasoning·coding·visual 이해 과제에서 특히 큰 개선을 달성했음을 드러낸다. 이 도표는 제안 방법의 전반적 효과성과 범용성을 직관적으로 보강한다.
DOPD와 여러 OPD 계열 방법들의 벤치마크별 및 평균 성능을 막대 그래프로 비교한 그림이다.

이 그래프는 DOPD가 초중반부터 성능을 빠르게 개선하고 후반에도 안정적으로 수렴해 최종 성능 우위를 확보함을 보여준다. 선폭은 실험 반복의 분산을 나타내며 DOPD가 다른 방법들보다 일관된 향상을 유지함을 시사한다. 이 자료는 제안한 라우팅이 학습 안정성과 효율성에 긍정적 영향을 미친다는 근거가 된다.
학습 스텝에 따른 성능 곡선을 통해 여러 OPD 변형들의 학습 효율과 수렴 특성을 비교한 선 그래프이다.

그래프는 DOPD가 교사-학생 크기 비율이 커질수록 Vanilla OPD보다 훨씬 안정적으로 성능 이득을 유지함을 보여준다. 특히 가장 큰 규모 불일치 환경에서도 DOPD는 유의미한 격차 회복률을 달성하여 스케일 민감성을 줄이는 효과가 확인되었다. 이 결과는 DOPD의 라우팅 규칙이 큰 용량 차이를 완화하는 데 기여함을 시사한다.
교사-학생 모델 크기 비율에 따른 성능 이득과 격차 감소를 비교한 그래프로서 확장성 실험 결과를 제시하고 있다.
기술 상세
전체 아키텍처는 세 가지 정책 구성요소로 이해할 수 있다: 배포되는 학생 정책(온-정책 샘플링용), 특권 입력을 받는 파라미터 공유의 privileged student, 그리고 고정된 privileged teacher이다. 학습 루프는 학생 정책으로 토큰 궤적을 샘플링한 뒤 각 토큰에 대해 privileged student와 privileged teacher의 확률을 추가로 계산해 토큰별 지표를 얻는다. privileged student는 배포 학생과 파라미터를 공유하되 특권 입력을 주입해 별도 순전파만 수행한다.
핵심 수학적 요소는 privilege advantage gap A로, 특정 토큰 y_n에 대해 A=|log Π_T(y_n|x,p,y_{<n}) − log Π_S(y_n|x,p,y_{<n})|로 정의된다. 이 값과 두 정책의 확률 합(q_S+q_T)의 배치 평균과 비교해 네 가지 토큰 분류 마스크(𝕀_LH, 𝕀_LL, 𝕀_HT, 𝕀_HS)를 생성한다. 마스크에 따라 손실은 Top-K reverse KL, full-vocabulary JS, 또는 privileged-student를 대상으로 한 stop-gradient 포함 reverse KL 등의 형태로 계산되며 이들을 마스크 합으로 결합해 최종 손실을 얻는다.
연산 선택은 실용적 고려를 반영했다. Top-K 정합은 K=128로 설정해 계산과 신호 밀도 사이의 균형을 맞추었고 full-vocabulary JS는 우위 격차가 큰 토큰에만 적용해 계산 오버헤드를 제한했다. β_w와 β_l은 각각 0.3과 0.6으로 조정해 약한 정규화와 가벼운 교사 전이의 기여도를 제어했다. 교사는 훈련 중 고정한 채 학생만 AdamW로 업데이트하며 GPU 자원으로는 논문 실험에서 8장 H200 141GB 환경을 사용했다.
정규화와 안정성 조치로는 배치 내 상위 5% 아웃라이어 제거, 배치-단위 정규화, privileged student에 대한 stop-gradient 적용이 포함되며 이로써 타깃 드리프트를 방지하고 라우팅의 안정성을 확보했다. 또한 실험에서 Top-K 대상과 full-vocabulary 대상의 성능·메모리 트레이드오프를 분석해 다양한 합리적 설정을 권장하고 있다.
관련 Figure

DOPD는 초기 약간의 엔트로피 증가 후 점진적 감소로 안정적인 탐색-수렴 패턴을 형성했으며, 일부 자기증류 계열은 엔트로피 붕괴를 겪어 성능 저하로 이어졌다. 이 결과는 특권 환상을 억제하면서 과도한 수렴을 방지하는 DOPD의 토큰별 라우팅 효과를 뒷받침한다. 엔트로피 수준은 학습 중 탐색 능력과 불필요한 확신의 억제를 동시에 반영하는 지표로 활용되었다.
학습 스텝에 따른 엔트로피 추이를 보여주는 그래프로서 여러 OPD 방식의 탐색성 변화를 비교하고 있다.
한계점
논문에서 명시한 제약은 세 가지이다. 첫째, DOPD는 고품질의 특권 입력을 필요로 하며 해당 입력을 생성하거나 주석하는 비용이 추가로 발생한다. 둘째, privileged student의 추가 순전파로 인해 Vanilla OPD 대비 계산 비용과 메모리 부담이 증가한다. 셋째, 현재의 라우팅 규칙은 휴리스틱에 기반해 설계되어 있으며 더 원리적이거나 학습 가능한 라우팅 기법으로 개선할 여지가 남아 있다.
실무 활용
DOPD는 특권 입력을 이용할 수 있는 환경에서 학생 모델의 성능을 체계적으로 향상시키는 실험적 근거를 제공한다. 추가 전방 패스와 토큰별 라우팅을 허용할 수 있는 인프라에서 적용 가능하며 reasoning·coding·vision 계열의 후처리 증류 과정에 유용하다. 코드 공개는 논문 메타데이터에 없으므로 구현 시 논문의 수치와 하이퍼파라미터를 재현해야 한다.
- 대형 교사 모델이 생성한 단계별 추론 힌트를 활용해 소형 학생 모델의 reasoning 능력을 향상시키는 모델 경량화 파이프라인.
- 시각적 바운딩 박스와 객체 레이블을 특권 입력으로 사용해 VLM 학생의 시각 이해 성능을 높이는 증류 워크플로.
- 순차적 데이터 도메인을 학습하는 연속 학습 시나리오에서 기존 능력 유지와 새로운 능력 축적을 동시에 확보하려는 운영 환경.
코드 공개 여부: 미확인
키워드
용어 해설
- On-policy Distillation
- — 학생 정책으로부터 실제 샘플된 궤적에 대해 교사가 토큰 단위로 밀도 높은 감독 신호를 주어 분포 편향을 줄이고 더 효율적으로 능력을 전이하는 증류 기법이다. 학생이 현재 정책으로 생성한 토큰을 입력으로 삼아 교사와의 확률 차이를 학습 신호로 사용하며 분포 불일치 문제를 완화한다. 본 논문에서 OPD는 토큰별 신호 비균일성과 특권 정보의 영향에 민감한 대상이다.
- Privileged Information
- — 학습 시 교사나 학생에게 추가로 제공되는 보조 문맥으로서 예컨대 단계별 추론 힌트나 객체의 구조화된 시각 주석이 이에 해당한다. 해당 입력은 예측 분포를 현저히 개선할 수 있으나 정보 비대칭을 통해 학생이 단순히 모방하는 특권 환상을 유발할 수 있다. 논문은 이러한 위험을 완화하면서 전이 가능한 능력만 선별 전이하는 방식을 목표로 삼았다.
- Privilege Advantage Gap
- — 동일한 특권 입력을 준 상태에서 교사와 학생이 특정 토큰에 부여한 로그확률의 차이의 절대값으로 정의되는 지표이다. 이 값은 해당 토큰이 교사로부터 진짜 전이 가능한 능력 신호를 포함하는지 아니면 단순한 특권 정보 의존인지 분리하는 근거로 사용된다. 논문은 이 격차를 기준으로 토큰별로 다른 감독원천과 강도를 동적으로 결정한다.
- Top-K Distillation
- — 교사 분포의 상위 K개 토큰 확률에 대해서만 학생 분포를 정렬하거나 역방향 KL을 적용해 부분적 분포 정합을 수행하는 전략이다. 전체 어휘를 맞추는 것보다 연산 부담을 줄이면서 유의미한 후보군에 집중하는 방식이며 본 논문에서는 K=128로 사용되었다. 토큰별 신뢰도에 따라 Top-K와 full-vocabulary를 선택적으로 적용한다.
- JS Divergence
- — 교사와 학생 분포의 중간 분포에 대한 양쪽 KL의 평균으로 정의되는 대칭적 발산 지표이다. 이 발산은 지원(coverage)과 모드 집중(mode concentration) 사이의 균형을 제공하므로 전 범위 분포 정합을 요구할 때 안정적인 목표로 활용된다. 논문은 우위 격차가 큰 토큰에 대해 full-vocabulary JS를 적용해 풍부한 2차 선호까지 전이하려 했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.