TL;DR
로컬 LLM 추론에서는 양자화와 최적화된 커널 외에도 추가 GPU 없이 생성 속도를 높이는 Speculative Decoding이 활용됩니다. DSpark는 병렬적으로 후보 토큰을 만들면서 앞선 예측 정보를 뒤쪽 토큰에 전달하는 가벼운 순차 구성 요소를 결합하고, 낮은 신뢰도의 후보를 검증 전에 버립니다. Qwen3-8B와 llama.cpp를 사용한 실험에서 생성 속도는 기준 95.0 tokens/s에서 DSpark 적용 후 124.9 tokens/s로 올라 1.31배, 약 31.5% 향상됐습니다. 다만 호환 가능한 draft model이 적고 llama.cpp 지원이 새로워서 현재는 MTP보다 적용 범위가 좁습니다.
섹션별 상세
apt-get update
apt-get install -y git cmake build-essentialllama.cpp를 소스에서 빌드하기 전에 Git, CMake, C++ 빌드 도구를 설치합니다.
cd /workspace
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF \
-DGGML_CUDA=ON
cmake --build llama.cpp/build \
--config Release \
-j \
--clean-first \
--target llama-cli llama-mtmd-cli llama-server llama-gguf-splitllama.cpp를 내려받고 CUDA 지원을 활성화한 Release 빌드로 실행 파일을 생성합니다.

./build/bin/llama-cli \
-m /workspace/models/Qwen3-8B-Q4_K_M.gguf \
-ngl all \
-fa on \
--temp 0 \
--top-k 1 \
-n 512 \
-st \
-p "Write a complete Python implementation of merge sort. Explain how it works and include its time and space complexity. /no_think"DSpark를 끈 상태에서 Qwen3-8B의 기준 생성 속도를 측정합니다.

./build/bin/llama-cli \
-m /workspace/models/Qwen3-8B-Q4_K_M.gguf \
-md /workspace/models/dspark-Qwen3-8B-Q8_0.gguf \
--spec-type draft-dspark \
--spec-draft-n-max 3 \
-ngl all \
-ngld all \
-fa on \
--temp 0 \
--top-k 1 \
-n 512 \
-st \
-p "Write a complete Python implementation of merge sort. Explain how it works and include its time and space complexity. /no_think"동일한 target model과 프롬프트에 DSpark draft model을 연결해 추측 디코딩 속도를 측정합니다.

용어 해설
- 추측 디코딩(Speculative Decoding)
- — 추측 디코딩은 작은 draft model이 다음 토큰을 먼저 여러 개 생성하고, target model이 이를 한 번에 검증하는 추론 최적화 기법입니다. 검증에 통과한 토큰을 재사용해 target model의 순차적 계산 횟수를 줄이며, 추가 GPU 없이 토큰 생성 속도를 높이는 데 목적이 있습니다.
- 다중 토큰 예측(Multi-Token Prediction)
- — Multi-Token Prediction은 한 번의 계산에서 여러 미래 토큰을 예측해 자동회귀 생성의 순차 처리 부담을 줄이는 방식입니다. 글에서는 MTP가 추측 디코딩에 활용되는 기존 접근으로 소개되며, DSpark와 비교되는 실용적인 대안으로 제시됩니다.
- 초안 모델(Draft Model)
- — Draft model은 target model이 최종 출력을 만들기 전에 후보 토큰을 빠르게 생성하는 보조 모델입니다. DSpark 실험에서는 dspark-Qwen3-8B-Q8_0.gguf가 초안 모델로 사용되고, target model인 Qwen3-8B가 후보 토큰을 검증합니다.
- GGUF 모델 형식(GGUF)
- — GGUF는 llama.cpp에서 로컬 모델을 실행할 때 사용하는 모델 파일 형식입니다. 실험에서는 Qwen3-8B-Q4_K_M.gguf를 target model로, dspark-Qwen3-8B-Q8_0.gguf를 DSpark draft model로 내려받아 CUDA 기반 추론에 사용합니다.
- Flash Attention
- — Flash Attention은 Attention 계산의 메모리 접근과 처리 과정을 최적화하는 추론 기능입니다. 이 실험에서는 baseline과 DSpark 실행 모두에서 -fa on 옵션으로 활성화해 speculative decoding의 속도 변화만 비교하도록 조건을 맞춥니다.
기술
- DSpark
- Qwen3-8B
- llama.cpp
- CUDA
- Hugging Face CLI
- GGUF
- Flash Attention
- MTP
- Medusa
- EAGLE
- DFlash
활용 사례
- 단일 GPU에서 실행하는 로컬 LLM 추론
- 긴 응답을 생성하는 코드 생성 작업
- 추가 GPU 없이 토큰 생성 처리량을 높이는 실험
- llama.cpp 기반 Qwen3-8B 서비스
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.