TL;DR
Speculative Decoding은 작은 draft 모델이 여러 토큰을 먼저 만들고 큰 target 모델이 이를 한 번에 검증해, 토큰을 하나씩 생성하는 반복 횟수를 줄이는 방식입니다. Draft Length는 GEMM을 compute-bound 영역으로 밀어 넣되 KV cache 압력을 키우지 않는 범위에서 정하고, attention이 지배적이면 D = 128/G - 1을 출발점으로 삼습니다. 매우 낮은 latency에서는 Acceptance Length 증가분이 draft 생성 비용을 상쇄할 때만 D를 늘려야 하며, EAGLE-3·MTP·DFlash·DSpark·외부 draft 모델·suffix 또는 n-gram 방식은 수용 길이와 메모리·학습 비용의 조합이 서로 다릅니다. NVIDIA는 SPEED-Bench로 현실적인 작업별 Acceptance Length를 측정하고 NVIDIA TensorRT LLM으로 draft overhead와 최종 decode 속도를 함께 측정하도록 권장합니다.
빠른 이해
새로운 점
Speculative Decoding의 Draft Length와 draft mechanism을 하드웨어·작업·학습 비용까지 포함한 모델 공동 설계 문제로 묶고, SPEED-Bench와 NVIDIA TensorRT LLM을 이용한 측정 절차를 함께 제시한 점입니다.
핵심 메커니즘
작은 draft 모델이 batch별로 D개의 후보 토큰을 생성하면 큰 target 모델이 이를 한 번에 병렬 검증하고, 첫 불일치 전까지 승인된 토큰과 target 모델의 새 토큰을 출력합니다. Acceptance Length AL은 한 반복에서 승인된 draft 토큰 수에 target 모델이 추가한 1개 토큰을 더한 값으로, D일 때 1부터 1+D까지입니다. 속도는 target 모델이 AL개 토큰을 순차 생성하는 시간과 D개 후보를 병렬 검증하는 시간, draft 생성 시간의 비율로 결정되므로 AL만 높이는 방식으로는 충분하지 않습니다. Attention이 지배적이면 시작값을 로 두고, G는 query heads per KV head이며 를 128의 배수에 맞춰 tile underutilization을 줄입니다. 낮은 latency에서 라 하면 근사 speedup은 이고 draft overhead는 이므로, D 증가는 AL 증가분이 추가 draft cost를 넘을 때만 의미가 있습니다.
핵심 수치
- Qwen 3.5 35B A3B의 Acceptance Length: AL 6 at D = 9, 32K split- SPEED-Bench에서 Qwen 3.5 122B A10B를 target으로 측정
- 4B draft의 Acceptance Length: AL > 5, 32K split- SPEED-Bench에서 Qwen 3.5 122B A10B를 target으로 측정
- Qwen 3.5 122B MTP 규모: 2.5B total parameters, fewer than 150M active parameters- D=3에서 외부 draft의 추가 비용과 비교해야 하는 기준
- MTP와 DFlash의 draft overhead: D = 11에서 MTP 11Ltarget, DFlash 5Ltarget- one-layer MTP head는 11 steps, five-layer DFlash head는 one pass
- 외부 draft의 학습 토큰 범위: From scratch: 1T-10T+ tokens; distilled: 100B-400B; adapted: 10M-1B- draft 생성 방식에 따른 training cost 범위
- post-trained drafter의 추가 학습: EAGLE-3·DFlash·DSpark: 1-10B additional tokens after target training- MTP는 target과 함께 co-train하며, 외부 draft는 별도 학습 방식에 따라 비용이 달라짐
섹션별 상세
Speculative Decoding 작동 원리
Draft Length와 연산 균형
낮은 지연 시간의 선택 기준
Draft Mechanism별 trade-off
SPEED-Bench와 배포 검증
용어 해설
- Speculative Decoding
- — 작은 draft 모델이 다음 토큰 여러 개를 먼저 생성하고, 큰 target 모델이 이를 한 번에 병렬 검증하는 추론 기법입니다. 검증을 통과한 토큰만 유지하므로 일반적인 순차 생성과 같은 출력 순서를 보존하면서 target 모델의 반복 실행 횟수와 메모리·연산 병목을 줄입니다.
- Draft Length
- — 한 번의 target 모델 검증 단계에 앞서 draft 모델이 제안하는 토큰 수입니다. 값이 커지면 target 모델의 검증 횟수는 줄어들지만 draft 생성 비용과 KV cache 압력이 증가할 수 있어, 하드웨어와 작업별 acceptance length 사이의 균형이 필요합니다.
- Acceptance Length
- — 한 번의 target 모델 반복에서 draft 모델이 제안한 토큰 가운데 target 모델이 받아들이는 토큰 수에 새로 생성된 정답 토큰을 더한 값입니다. Draft Length가 D일 때 Acceptance Length는 1부터 1+D까지이며, 실제 가속 효과를 판단하는 핵심 지표입니다.
- KV Cache
- — Transformer의 이전 토큰에 대한 key와 value를 저장해 긴 시퀀스를 생성할 때 같은 attention 계산을 반복하지 않도록 하는 메모리 구조입니다. Speculative Decoding에서 draft 길이를 늘리면 검증 대상 토큰과 함께 필요한 저장 공간이 커질 수 있어 처리량과 메모리 압력 사이의 조정이 필요합니다.
- Compute-Bound
- — 프로그램 실행 시간이 메모리 이동이나 대기보다 행렬 연산 처리 능력에 의해 주로 제한되는 상태입니다. 이 글에서는 draft 토큰을 묶어 target 모델의 GEMM 작업량을 키우고, 작은 batch에서 attention보다 행렬 연산이 차지하는 비중을 높여 처리량과 상호작용성의 Pareto frontier를 개선하는 맥락으로 사용됩니다.
- Pareto Frontier
- — 처리량과 상호작용성처럼 서로 trade-off 관계에 있는 두 지표에서 한쪽을 더 개선하려면 다른 쪽을 희생해야 하는 최적 선택들의 경계입니다. 글에서는 batch size와 draft 길이를 조절해 latency와 throughput 사이의 운영 지점을 선택하고, 각 지점에 맞는 draft mechanism을 고르는 기준으로 사용합니다.
기술
- Speculative Decoding
- LLM
- GEMM
- KV Cache
- attention
- EAGLE-3
- MTP
- DFlash
- DSpark
- SPEED-Bench
- Qwen 3.5 122B A10B
- Qwen 3.5 35B A3B
- NVIDIA TensorRT LLM
- NVIDIA/Model-Optimizer
- NVIDIA Nemotron 3.5 Lightning
- FP8
- NVFP4
- Grouped GEMMs
- MoE
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.