본문으로 건너뛰기

Speculative Decoding으로 더 빠른 LLM 추론을 위한 AI 모델 공동 설계

Draft 모델의 토큰 제안과 target 모델의 병렬 검증으로 LLM 생성 반복을 줄이는 설계 기준입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Speculative Decoding은 작은 draft 모델이 여러 토큰을 먼저 만들고 큰 target 모델이 이를 한 번에 검증해, 토큰을 하나씩 생성하는 반복 횟수를 줄이는 방식입니다. Draft Length는 GEMM을 compute-bound 영역으로 밀어 넣되 KV cache 압력을 키우지 않는 범위에서 정하고, attention이 지배적이면 D = 128/G - 1을 출발점으로 삼습니다. 매우 낮은 latency에서는 Acceptance Length 증가분이 draft 생성 비용을 상쇄할 때만 D를 늘려야 하며, EAGLE-3·MTP·DFlash·DSpark·외부 draft 모델·suffix 또는 n-gram 방식은 수용 길이와 메모리·학습 비용의 조합이 서로 다릅니다. NVIDIA는 SPEED-Bench로 현실적인 작업별 Acceptance Length를 측정하고 NVIDIA TensorRT LLM으로 draft overhead와 최종 decode 속도를 함께 측정하도록 권장합니다.

빠른 이해

새로운 점

Speculative Decoding의 Draft Length와 draft mechanism을 하드웨어·작업·학습 비용까지 포함한 모델 공동 설계 문제로 묶고, SPEED-Bench와 NVIDIA TensorRT LLM을 이용한 측정 절차를 함께 제시한 점입니다.

핵심 메커니즘

작은 draft 모델이 batch별로 D개의 후보 토큰을 생성하면 큰 target 모델이 이를 한 번에 병렬 검증하고, 첫 불일치 전까지 승인된 토큰과 target 모델의 새 토큰을 출력합니다. Acceptance Length AL은 한 반복에서 승인된 draft 토큰 수에 target 모델이 추가한 1개 토큰을 더한 값으로, D일 때 1부터 1+D까지입니다. 속도는 target 모델이 AL개 토큰을 순차 생성하는 시간과 D개 후보를 병렬 검증하는 시간, draft 생성 시간의 비율로 결정되므로 AL만 높이는 방식으로는 충분하지 않습니다. Attention이 지배적이면 시작값을 D=128/G1D = 128/G - 1로 두고, G는 query heads per KV head이며 G×(1+D)G × (1 + D)를 128의 배수에 맞춰 tile underutilization을 줄입니다. 낮은 latency에서 ρ=Ldraft/Ltargetρ = Ldraft/Ltarget라 하면 근사 speedup은 AL/(1+ρD)AL/(1 + ρD)이고 draft overhead는 ρDρD이므로, D 증가는 AL 증가분이 추가 draft cost를 넘을 때만 의미가 있습니다.

핵심 수치

  • Qwen 3.5 35B A3B의 Acceptance Length: AL 6 at D = 9, 32K split- SPEED-Bench에서 Qwen 3.5 122B A10B를 target으로 측정
  • 4B draft의 Acceptance Length: AL > 5, 32K split- SPEED-Bench에서 Qwen 3.5 122B A10B를 target으로 측정
  • Qwen 3.5 122B MTP 규모: 2.5B total parameters, fewer than 150M active parameters- D=3에서 외부 draft의 추가 비용과 비교해야 하는 기준
  • MTP와 DFlash의 draft overhead: D = 11에서 MTP 11Ltarget, DFlash 5Ltarget- one-layer MTP head는 11 steps, five-layer DFlash head는 one pass
  • 외부 draft의 학습 토큰 범위: From scratch: 1T-10T+ tokens; distilled: 100B-400B; adapted: 10M-1B- draft 생성 방식에 따른 training cost 범위
  • post-trained drafter의 추가 학습: EAGLE-3·DFlash·DSpark: 1-10B additional tokens after target training- MTP는 target과 함께 co-train하며, 외부 draft는 별도 학습 방식에 따라 비용이 달라짐

섹션별 상세

01

Speculative Decoding 작동 원리

LLM의 autoregressive decoding은 다음 토큰을 하나씩 생성하므로 각 반복마다 큰 target 모델을 순차 실행해야 하는 문제가 있습니다. Speculative Decoding은 작은 draft 모델이 D개의 후보 토큰을 먼저 만들고, target 모델이 이 후보들을 한 번의 forward pass에서 병렬 검증하도록 순서를 바꿉니다. Target 모델은 첫 번째 불일치 직전까지 후보를 받아들이고 그 지점에서 다음 cycle을 재개하므로, 승인된 토큰과 target 모델이 새로 만든 토큰만 최종 출력에 남습니다. 따라서 acceptance criteria를 완화하지 않는 한 표준 decoding과 같은 출력 순서를 유지하면서 target 모델의 반복 횟수와 interactivity 병목을 함께 낮춥니다.
02

Draft Length와 연산 균형

Draft Length를 무작정 늘리면 검증할 토큰 수가 증가해 GEMM이 더 compute-bound에 가까워지지만, KV cache capacity pressure와 통신 비용도 커질 수 있습니다. Attention이 decode 시간을 주도하는 운영 지점에서는 그룹 크기 G를 query heads per KV head로 둘 때 시작값을 D=128/G1D = 128/G - 1로 잡고, 더 큰 D에서는 G×(1+D)G × (1 + D)가 128의 배수가 되는 값을 선호해 attention kernel tile의 미사용 영역을 줄입니다. 여기서 D는 target 반복당 draft 후보 수이고 G는 query heads와 KV heads의 비율이므로, 입력은 head 구성과 후보 토큰 수이며 처리는 128 크기 tile에 맞춘 검증 batch 구성이고 출력은 더 높은 kernel 활용도입니다. 다만 FFN과 attention이 runtime에서 차지하는 비율에 따라 이 기준의 상대적 중요도가 달라지며, D 증가로 인한 통신 비용은 compute와 communication overlap 여부에 따라 달라집니다.
03

낮은 지연 시간의 선택 기준

Pareto curve의 오른쪽처럼 batch size가 매우 작아지면 compute와 communication kernel의 고정 setup·post-processing 비용이 전체 latency를 지배하므로, 검증 토큰 수가 늘어도 검증 overhead가 크게 증가하지 않을 수 있습니다. 이 구간에서는 MoE의 활성 expert 수 증가를 model sharding과 Grouped GEMMs로 낮게 유지할 수 있어, Acceptance Length가 충분히 높다면 더 긴 D가 유리합니다. Autoregressive draft 모델의 layer 수를 target의 Ltarget, draft의 layer 수를 Ldraft라고 하면 ρ=Ldraft/Ltargetρ = Ldraft/Ltarget이고, 근사 speedup은 AL/(1+ρD)AL/(1 + ρD), draft overhead는 ρDρD로 표현됩니다. 예를 들어 같은 layer 구조의 draft는 D가 커질수록 overhead가 선형 증가하므로, Acceptance Length 증가분이 추가 draft cost보다 클 때만 D를 늘려야 합니다.
04

Draft Mechanism별 trade-off

외부 draft model은 별도 소형 LLM으로 token ID를 입력받아 D번 autoregressive forward pass를 수행하고, EAGLE-3와 MTP는 target의 hidden state를 활용하는 보조 decoder layer와 linear projection을 반복 실행합니다. DFlash와 DSpark는 target hidden state를 draft KV로 융합해 약 5개 layer를 한 번에 실행하고, DSpark는 뒤이어 lightweight Markov head로 순차 보정을 수행하며 suffix·n-gram은 모델 없이 token stream의 반복 패턴을 lookup합니다. 예를 들어 D=11에서 한 layer MTP head는 11 steps가 필요해 draft overhead가 11Ltarget이지만, five-layer DFlash head는 한 pass로 생성해 5Ltarget이므로 작은 target 모델과 낮은 latency에서는 더 낮은 AL에도 DFlash 또는 DSpark가 유리할 수 있습니다. 반대로 반복 패턴이 많은 작업에는 n-gram이 맞고, 큰 GPU 모델에서는 병렬 draft 비용과 acceptance length를 함께 측정해야 실제 decode speedup을 판단할 수 있습니다.
05

SPEED-Bench와 배포 검증

Acceptance Length가 높다는 사실만으로 최종 speedup이 보장되지 않으므로, draft latency와 학습·배포 비용을 같은 조건에서 측정해야 합니다. NVIDIA가 개발한 SPEED-Bench는 coding과 summarization을 포함한 여러 task domain, 다양한 입력 sequence length split, 현실적인 production workload를 제공해 draft 길이에 따른 AL을 비교하는 기준으로 사용됩니다. 32K split에서 Qwen 3.5 122B A10B를 target으로 할 때 Qwen 3.5 35B A3B는 D=9에서 AL 6에 도달했고, 4B draft는 AL 5를 넘었으며, MTP와 DFlash의 AL은 D 증가와 함께 빠르게 평탄해졌습니다. 배포 전에는 NVIDIA TensorRT LLM으로 draft overhead를 측정하고, NVIDIA/Model-Optimizer의 EAGLE-3·DFlash·DSpark 학습 예제와 NVIDIA Nemotron 3.5 Lightning의 DSpark Fine-tuning 및 FP8·NVFP4 Quantization 흐름을 출발점으로 삼은 뒤 자체 모델·작업·하드웨어에서 AL과 end-to-end 속도를 다시 검증해야 합니다.

용어 해설

Speculative Decoding
작은 draft 모델이 다음 토큰 여러 개를 먼저 생성하고, 큰 target 모델이 이를 한 번에 병렬 검증하는 추론 기법입니다. 검증을 통과한 토큰만 유지하므로 일반적인 순차 생성과 같은 출력 순서를 보존하면서 target 모델의 반복 실행 횟수와 메모리·연산 병목을 줄입니다.
Draft Length
한 번의 target 모델 검증 단계에 앞서 draft 모델이 제안하는 토큰 수입니다. 값이 커지면 target 모델의 검증 횟수는 줄어들지만 draft 생성 비용과 KV cache 압력이 증가할 수 있어, 하드웨어와 작업별 acceptance length 사이의 균형이 필요합니다.
Acceptance Length
한 번의 target 모델 반복에서 draft 모델이 제안한 토큰 가운데 target 모델이 받아들이는 토큰 수에 새로 생성된 정답 토큰을 더한 값입니다. Draft Length가 D일 때 Acceptance Length는 1부터 1+D까지이며, 실제 가속 효과를 판단하는 핵심 지표입니다.
KV Cache
Transformer의 이전 토큰에 대한 key와 value를 저장해 긴 시퀀스를 생성할 때 같은 attention 계산을 반복하지 않도록 하는 메모리 구조입니다. Speculative Decoding에서 draft 길이를 늘리면 검증 대상 토큰과 함께 필요한 저장 공간이 커질 수 있어 처리량과 메모리 압력 사이의 조정이 필요합니다.
Compute-Bound
프로그램 실행 시간이 메모리 이동이나 대기보다 행렬 연산 처리 능력에 의해 주로 제한되는 상태입니다. 이 글에서는 draft 토큰을 묶어 target 모델의 GEMM 작업량을 키우고, 작은 batch에서 attention보다 행렬 연산이 차지하는 비중을 높여 처리량과 상호작용성의 Pareto frontier를 개선하는 맥락으로 사용됩니다.
Pareto Frontier
처리량과 상호작용성처럼 서로 trade-off 관계에 있는 두 지표에서 한쪽을 더 개선하려면 다른 쪽을 희생해야 하는 최적 선택들의 경계입니다. 글에서는 batch size와 draft 길이를 조절해 latency와 throughput 사이의 운영 지점을 선택하고, 각 지점에 맞는 draft mechanism을 고르는 기준으로 사용합니다.

기술

  • Speculative Decoding
  • LLM
  • GEMM
  • KV Cache
  • attention
  • EAGLE-3
  • MTP
  • DFlash
  • DSpark
  • SPEED-Bench
  • Qwen 3.5 122B A10B
  • Qwen 3.5 35B A3B
  • NVIDIA TensorRT LLM
  • NVIDIA/Model-Optimizer
  • NVIDIA Nemotron 3.5 Lightning
  • FP8
  • NVFP4
  • Grouped GEMMs
  • MoE

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 09. 03.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.