TL;DR
구조화 가지치기는 서빙 친화적 압축 수단이지만 다수의 이전 평가가 채택한 선택형 벤치마크에서만 보존된 성능이 실제 자유형 생성에서는 급락하는 문제가 존재했다. 이 논문은 손상된 학생 모델의 올바른 생성 궤적이 샘플링 분포 안에 여전히 남아있음을 보이고 해당 궤적을 밀도화된 토큰 수준 목표로 복원하는 방법이 효과적임을 실험적으로 입증했다. 더불어 반복 접미사가 초반 온-폴리시 학습 예산을 낭비한다는 점을 규명해 계산 비용을 줄이면서 회복 속도를 높이는 운영적 제어가 가능함을 보였다.
왜 중요한가
구조화 가지치기는 서빙 친화적 압축 수단이지만 다수의 이전 평가가 채택한 선택형 벤치마크에서만 보존된 성능이 실제 자유형 생성에서는 급락하는 문제가 존재했다. 이 논문은 손상된 학생 모델의 올바른 생성 궤적이 샘플링 분포 안에 여전히 남아있음을 보이고 해당 궤적을 밀도화된 토큰 수준 목표로 복원하는 방법이 효과적임을 실험적으로 입증했다. 더불어 반복 접미사가 초반 온-폴리시 학습 예산을 낭비한다는 점을 규명해 계산 비용을 줄이면서 회복 속도를 높이는 운영적 제어가 가능함을 보였다.
핵심 기여
온-폴리시 토큰 수준 증류(OPD)를 복원 신호로 체계적으로 검증
학생이 샘플링한 동일 궤적에 대해 압축 전 자기 자신을 고정된 교사로 사용하여 각 토큰의 교사 분포를 목표로 삼는 OPD가 오프폴리시 SFT, SeqKD, 그리고 고정 교사-강제 KD보다 생성 회복에 더 효과적임을 보였다. 동일한 복구 코퍼스와 시간 예산 하에서 OPD 계열이 평균 복구 성능을 크게 끌어올렸다. 이 결과는 복원 신호가 상태 분포와 신호 밀도로 규정된다는 진단을 실험적으로 지지한다.
반복-게이티드 단축-확장 롤아웃 예산 제어 규칙 ShortOPD 설계
롤아웃 말미의 심한 반복을 탐지하고 그때 관측된 유효 접두 길이의 EMA를 이용해 예산을 단축할지 확장할지 결정하는 반복-게이트와 절단율 기반 성장 조건을 도입했다. 제어 규칙은 배치 통계의 EMA로 노이즈를 억제하고 예산 변화에 히스테리시스를 주어 진동을 방지하도록 설계되었다. 이 제어 루프는 초기 반복 구간에서 낭비되는 교사 계산을 줄이고 회복을 가속했다.
광범위한 작업군과 비용 지표로 회복 효과와 효율성 입증
Qwen3-4B-Instruct의 25퍼센트 깊이 가지치기 실험에서 ShortOPD는 8개 작업 평균에서 48.46 점을 달성해 비훈련 상태(5.71) 대비 약 9배, 최선의 오프폴리시 KD 대비 약 18 포인트 우위를 기록했다. ShortOPD는 고정 8192 토큰 롤아웃과 유사한 품질을 내면서 롤아웃 토큰 수를 71퍼센트 줄였고 실제 학습 시간은 35.9시간에서 8.5시간으로 단축되었다. 추가로 도메인 제거 실험에서 수집된 증거는 회복 코퍼스의 도메인 커버리지가 회복 성능에 직접적 영향을 준다는 점을 보여주었다.
핵심 아이디어 이해하기
구조화 깊이 가지치기는 모델 파라미터 일부를 제거해 서빙 친화성을 확보하지만 생성 시퀀스에서 다음 토큰 순위가 일부 잘못 배치되어 연쇄적으로 품질 붕괴가 발생한다. 이런 오류는 정답 경로가 완전히 사라진 것이 아니라 샘플링 분포에서 낮은 확률로 남아 있어 여러 번 샘플링하면 회복 가능한 경우가 많다. 따라서 복원은 학생이 실제로 방문하는 상태에 대한 밀도화된 토큰 수준의 목표를 제공해야 하며, 이 점이 온-폴리시 증류(OPD)의 출발점이다.
관련 Figure

그림은 고정 H=2048 환경에서 초기 온-폴리시 단계가 반복 접미로 점유되어 손실이 오히려 낮게 머무르며 유의미한 회복 신호가 늦게 도래함을 보여준다. 이 시각적 증거는 긴 고정 예산이 회복을 지연시키며 반복 탐지를 통해 예산을 줄이면 손실 하강 시점을 앞당길 수 있음을 지지한다. 따라서 ShortOPD의 단축-확장 전략이 학습 속도와 효율성 측면에서 타당함을 뒷받침한다.
고정 긴 롤아웃에서 초기 단계에 distillation loss가 낮게 유지되는 동안 접미 반복률이 높게 유지되는 현상을 시간 축으로 보여주는 그래프이다.
방법론
OPD는 각 프롬프트에 대해 학생이 자신의 정책으로 롤아웃을 샘플링하고 동일한 궤적에 대해 압축 전 모델을 고정된 교사로 실행하여 모든 응답 위치에서 교사 분포를 얻는다. 학생은 학습 시 각 토큰 위치에 대해 generalized Jensen-Shannon divergence 기반의 분포적 손실을 최소화하며 본 논문에서는 상위 100개의 로그잇과 꼬리 질량을 포함해 밀집 목표를 만든다. 이 손실은 교사와 학생 간의 강한 용량 차이에서 발생하는 과도한 퍼짐이나 모드 회피를 완화하기 위해 α=0.5의 균형 선택을 사용했다.
관련 Figure

그래프는 깊이 기반 가지치기 깊이가 증가할수록 수식 문제와 코드, 오픈엔디드 생성에서 접미 반복 비율이 급격히 상승함을 나타낸다. 이 관찰은 반복 접미가 생성 실패의 주요 표지이며 반복을 제어하지 않으면 긴 롤아웃이 회복 초기에 비생산적임을 시사한다. 따라서 롤아웃 예산을 동적으로 조절해 반복 구간에 소비되는 교사 계산을 줄이는 설계 근거를 제공한다.
레이어를 제거한 후 접미 반복률이 제거된 층 수에 따라 급증하는 경향과 도메인별 반복률 차이를 보여주는 그래프이다.

다이어그램은 학생이 샘플링한 롤아웃을 교사가 점수화하고 토큰별 분포 목표를 계산하는 주 회로와 접미 반복 탐지 및 EMA 기반 목표 예산 계산으로 구성된 보조 제어 루프를 분리해 보여준다. 이 구조는 별도의 검증자나 레이블 없이 학생의 상태 분포에 직접 작용하는 실용적 구현임을 강조하며 제어 루프가 동일한 토큰을 재사용해 추가 전방 계산 없이 예산 결정을 수행함을 시각적으로 전달한다.
ShortOPD의 전체 파이프라인을 나타내는 다이어그램으로 학생 샘플링, 접미-반복 프로브, 롤아웃 통계, 컨트롤러, 교사 재평가 루프를 연결한 흐름을 도식화하고 있다.
주요 결과
주요 비교에서 ShortOPD는 Qwen3-4B-Instruct의 25퍼센트 가지치기된 학생에 대해 8개 작업 평균에서 48.46을 기록해 비훈련 상태와 오프폴리시 기반 복원법들을 큰 폭으로 앞섰다. 시간과 토큰 비용 관점에서 ShortOPD는 초기 반복 구간에서 예산을 2048에서 1024로 단축했다가 이후 재확장해 낭비된 반복 토큰을 줄였고 결과적으로 첫 100스텝에서 롤아웃 생성 시간이 평균 35.4초에서 25.1초로 29퍼센트 단축되었다. 고정 8192 토큰 롤아웃은 품질 개선이 미미한 반면 토큰과 월클럭 비용이 크게 증가했으므로 ShortOPD는 비용 효율적인 회복 경로임이 확인되었다.
관련 Figure

해당 그림은 ShortOPD가 반복 지배 구간을 빠르게 통과해 손실이 조기 평탄구간에 도달하는 반면, Vanilla는 더 오래 지연되는 패턴을 보여 ShortOPD의 효율성을 확인시킨다. 또한 ShortOPD가 예산을 1024로 줄였다가 다시 확장하는 동작을 통해 낭비된 접미 토큰을 줄였음을 수치적으로 확인할 수 있다. 이 결과는 계산 자원 절감과 품질 유지를 동시에 충족시킬 수 있음을 뒷받침한다.
ShortOPD와 Vanilla OPD의 학습 궤적 비교로 손실, 반복률, 낭비된 접미 토큰 및 동적 예산 변화를 시간 축으로 겹쳐 보여준다.

그래프는 ShortOPD가 고정 2048 대비 토큰과 시간에서 추가 절감을 달성하면서 평균 성능 손실이 작음을 수치로 보여준다. 특히 고정 8192 스케줄은 미미한 성능 이득에 비해 토큰과 시간이 크게 증가함을 명확히 드러낸다. 이 결과는 롤아웃 예산을 무조건 크게 설정하는 관행이 비용 대비 효율성이 낮음을 실무적으로 증명한다.
세 가지 회복 스케줄에 따른 생성된 롤아웃 토큰 수, 소요 시간, 그리고 작업군 평균 성능을 비교한 막대 그래프이다.

해당 그림은 ShortOPD가 GSM8K 단일 도메인 또는 멀티도메인 설정에서 RL 기반 희소 보상 방식이나 단순 SFT 기반 회복보다 월등히 높은 정확도를 달성함을 보여준다. 특히 RLVR 방법은 보상이 희박한 상황에서 거의 학습 신호를 얻지 못해 성능 향상이 미미함이 시각적으로 확인된다. 이 결과는 토큰 단위의 밀집 교사 분포가 희소 보상 대비 훨씬 강력한 복원 신호임을 실증한다.
GSM8K 정확도 비교 막대 그래프와 여러 방법론의 성능 대비 토큰 소모 차이를 요약한 시각 자료이다.
기술 상세
전체 아키텍처는 압축 전 원본 모델을 고정된 교사로 두고 삭제된 레이어를 가진 학생이 동일한 Transformer 기반 인코더-디코더 또는 디코더계열 구조로 동작하는 설정이다. 실험에 사용된 압축은 Block Influence 기반의 깊이 가지치기이며 약 25퍼센트 파라미터 제거를 중심으로 평가했다. OPD 손실은 학생 샘플링 분포에서 얻은 각 토큰 위치의 교사 분포와 학생 분포 간의 generalized Jensen-Shannon divergence를 평균화한 식으로 구현되며 상위 100개의 로그잇과 집계된 꼬리 질량을 포함한다.
한계점
실험은 Qwen3-4B-Instruct 계열과 Block Influence 깊이 가지치기 약 25퍼센트 환경에서 주로 수행되어 다른 모델 아키텍처, 가지치기 방식, 더 높은 압축 비율에 대한 보편성은 아직 검증되지 않았다. ShortOPD의 제어 규칙은 히스테리시스와 EMA 하이퍼파라미터에 민감하며 이들 값은 모델과 데이터에 따라 재조정이 필요할 수 있다. 또한 회복 성능은 회복에 사용된 프롬프트 분포의 도메인 커버리지에 강하게 의존한다는 점이 명시적으로 제시되었다.
실무 활용
ShortOPD는 구조화 가지치기 후 실제 생성 성능을 회복하려는 배포 환경에서 적용 가능하다. 반복률과 절단률을 모니터링하는 경량 제어기를 추가해 초기 학습 예산을 줄이면 동일한 혹은 유사한 품질을 더 적은 계산 자원으로 달성할 수 있다. 다만 도메인별 복구는 사용한 회복 프롬프트 분포의 커버리지에 의존하므로 회복 목적에 맞는 코퍼스 설계가 필요하다.
- 서비스에서 구조화 가지치기를 적용한 뒤 탐색적 재학습으로 자유형 응답 품질을 회복할 때 비용과 시간을 줄이기 위한 실무 재학습 파이프라인
- 제한된 교사 계산 자원으로 다양한 도메인 능력을 동시 복원해야 하는 운영 환경에서 도메인별 샘플링 비율을 조정해 효율성 확보
- 가지치기 실험 단계에서 회복 가능성 한계를 평가하기 위해 반복률과 유효 접두 길이 통계를 수집하는 진단 툴
코드 공개 여부: 미확인
관련 Figure

시간 비교 그래프는 ShortOPD가 초기 구간에서 평균 롤아웃 시간을 29퍼센트 줄였음을 보여주며 이는 전체 월클럭과 토큰 비용 감소로 이어진다. 비용 대비 품질 그래프는 고정 큰 예산이 거의 품질을 개선하지 못하면서 토큰 비용만 크게 증가함을 보여 ShortOPD의 비용 효율적 대안성을 강조한다. 실무에서는 계산 자원이 제한된 상황에서 ShortOPD가 현실적인 선택임을 시사한다.
학습 초기 100스텝 동안의 롤아웃 생성 시간 비교와 세 가지 스케줄 간 품질 대비 비용 트레이드오프를 보여주는 시각 자료이다.
키워드
용어 해설
- On-Policy Distillation
- — 학생 모델이 실제로 샘플링한 롤아웃을 교사 모델이 다시 채점하여 각 토큰별 분포 목표를 맞추는 기법이다. 학생의 탐색 분포에서 발생하는 상태들을 학습 신호로 사용하므로 분포 불일치 문제가 줄어든다. 이 논문에서는 압축된 학생이 스스로 생성한 문장에 대해 원형 교사 로그잇을 밀도 신호로 사용해 손상된 생성 능력을 회복하는 데 핵심 역할을 했다.
- Structured Pruning
- — Transformer 블록 전체나 연관된 파라미터 블록을 제거해 하드웨어 친화적으로 모델 크기를 줄이는 방식이다. 블록을 통째로 제거하므로 표준 밀집 연산으로 바로 서빙할 수 있고 특수 커널이나 스파스 가속 하드웨어가 필요 없다. 본문에서는 depth(층) 제거 형태의 구조화 가지치기가 주된 압축 실험 축으로 사용되었다.
- Block Influence
- — 레이어별로 블록이 은닉 상태를 얼마나 변화시키는지를 코사인 유사도로 측정한 지표이다. 낮은 값은 해당 레이어가 출력 표현에 거의 기여하지 않는다는 뜻이며 이를 기준으로 낮은 영향도의 레이어를 제거해 깊이 기반 가지치기를 수행한다. 논문 실험에서 25퍼센트 파라미터 제거 시의 레이어 선택에 이 측정값이 사용되었다.
- Suffix Repetition
- — 학생 모델의 롤아웃 말미에서 같은 토큰 열이 주기적으로 반복되는 현상을 가리킨다. 반복된 접미사는 교사와의 분포 차이를 거의 제공하지 않아 초기 온-폴리시 학습에서 정보 이득이 매우 낮다. 논문은 이 반복이 고정 긴 롤아웃 예산에서 회복을 지연시키는 주요 원인이라고 규정했다.
- Rollout Budget
- — 각 프롬프트별로 학생이 샘플링할 수 있는 최대 응답 토큰 수로 정의된 하이퍼파라미터이다. 고정으로 크게 잡으면 반복 접미수에 낭비되는 교사 계산량이 많아지고 작게 잡으면 합법적 긴 생성이 잘려 품질을 잃을 수 있다. ShortOPD는 이 예산을 반복률과 절단률을 기반으로 동적으로 조정한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.