본문으로 건너뛰기

JetSpec 병렬 트리 드래프팅으로 speculative decoding의 스케일링 한계 극복

Autoregressive LLM의 디코딩은 본질적으로 직렬적이어서 긴 생성 작업에서 지연이 주요 병목이다. 스펙큘레이티브 디코딩은 초안 생성과 병렬 검증으로 이 지연을 줄이지만 초안 예산을 늘릴 때는 acceptance rate과 초안 비용의 동시 개선이 필요하다. JetSpec은 병렬 예측의 효율성과 분기별(in-branch) 인과적 조건화를 동시에 확보하여 더 큰 초안 예산을 실제 accepted prefix 길이와 엔드투엔드 속도 향상으로 변환했다.

용어 해설

스펙큘레이티브 디코딩(Speculative Decoding)
스펙큘레이티브 디코딩은 경량의 drafter가 다수의 토큰을 초안으로 생성하고 대상 모델이 병렬로 검증하여 일치하는 가장 긴 접두사를 채택하는 추론 기법이다. 초안의 수와 초안 품질, 그리고 초안 생성 비용이 전체 속도 향상에 직접적으로 영향을 주며, 수식으로 속도향상 = (1-α^{N+1})/((1-α)(Nc+1)) 형태로 표현된다. 본 논문에서는 초안 예산을 늘릴 때 acceptance rate α와 토큰당 비용 c의 동시 개선이 핵심 병목이라 규정한다.
드래프트 헤드(Draft Head)
드래프트 헤드는 목표 모델의 중간 은닉 상태를 재사용하는 경량 예측 헤드로 한 번의 전방 패스로 여러 초안 토큰의 로짓을 생성한다. 별도 drafter 모델을 배포하지 않으면서도 낮은 per-token 비용을 달성하고 target-model의 신호를 반영하기 위해 hidden state를 KV에 주입하거나 feature fusion을 수행한다. JetSpec은 이러한 드래프트 헤드에 branch-wise causal conditioning을 더해 트리 드래프팅과 정합성을 확보한다.
트리 인과적 어텐션(Tree-Causal Attention)
트리 인과적 어텐션은 트리의 각 노드가 자신과 조상 노드의 토큰만 볼 수 있고 형제나 자손은 볼 수 없게 하는 마스킹 규칙이다. 이 마스크는 각 분기(branch)의 확률 분포가 해당 분기의 선행 토큰들에 조건화되도록 하여 병렬 계산으로도 autoregressive factorization과 유사한 분해를 유지한다. JetSpec은 이 마스크를 사용하여 모든 트리 깊이의 로짓을 병렬로 계산하면서 branch-wise causality를 보존했다.
Forward KL 증류(Forward KL Distillation)
Forward KL 증류는 대상 모델의 온도 조정된 확률 분포 p~를 교사로 삼아 드래프트 분포 q~가 그 확률 질량을 포괄하도록 KL(p~ || q~)를 최소화하는 목적이다. 본 논문에서는 forward KL이 mode-seeking 성향의 reverse KL보다 트리 드래프팅에서 수용 길이(accepted length)와 end-to-end speedup 관점에서 우수함이 관찰되었다. 학습 손실은 온도 T_KD와 활성 위치 마스크로 정규화된 평균 forward KL로 구성된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 25.수집 2026. 06. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.