용어 해설
- 스펙큘레이티브 디코딩(Speculative Decoding)
- — 스펙큘레이티브 디코딩은 경량의 drafter가 다수의 토큰을 초안으로 생성하고 대상 모델이 병렬로 검증하여 일치하는 가장 긴 접두사를 채택하는 추론 기법이다. 초안의 수와 초안 품질, 그리고 초안 생성 비용이 전체 속도 향상에 직접적으로 영향을 주며, 수식으로 속도향상 = (1-α^{N+1})/((1-α)(Nc+1)) 형태로 표현된다. 본 논문에서는 초안 예산을 늘릴 때 acceptance rate α와 토큰당 비용 c의 동시 개선이 핵심 병목이라 규정한다.
- 드래프트 헤드(Draft Head)
- — 드래프트 헤드는 목표 모델의 중간 은닉 상태를 재사용하는 경량 예측 헤드로 한 번의 전방 패스로 여러 초안 토큰의 로짓을 생성한다. 별도 drafter 모델을 배포하지 않으면서도 낮은 per-token 비용을 달성하고 target-model의 신호를 반영하기 위해 hidden state를 KV에 주입하거나 feature fusion을 수행한다. JetSpec은 이러한 드래프트 헤드에 branch-wise causal conditioning을 더해 트리 드래프팅과 정합성을 확보한다.
- 트리 인과적 어텐션(Tree-Causal Attention)
- — 트리 인과적 어텐션은 트리의 각 노드가 자신과 조상 노드의 토큰만 볼 수 있고 형제나 자손은 볼 수 없게 하는 마스킹 규칙이다. 이 마스크는 각 분기(branch)의 확률 분포가 해당 분기의 선행 토큰들에 조건화되도록 하여 병렬 계산으로도 autoregressive factorization과 유사한 분해를 유지한다. JetSpec은 이 마스크를 사용하여 모든 트리 깊이의 로짓을 병렬로 계산하면서 branch-wise causality를 보존했다.
- Forward KL 증류(Forward KL Distillation)
- — Forward KL 증류는 대상 모델의 온도 조정된 확률 분포 p~를 교사로 삼아 드래프트 분포 q~가 그 확률 질량을 포괄하도록 KL(p~ || q~)를 최소화하는 목적이다. 본 논문에서는 forward KL이 mode-seeking 성향의 reverse KL보다 트리 드래프팅에서 수용 길이(accepted length)와 end-to-end speedup 관점에서 우수함이 관찰되었다. 학습 손실은 온도 T_KD와 활성 위치 마스크로 정규화된 평균 forward KL로 구성된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

