TL;DR
작성자는 128 GB Unified Memory를 탑재한 Strix Halo에서 DeepSeek-V4-Flash-0731과 두 DSpark Drafter의 speculative decoding 성능을 비교했습니다. 7개 작업 유형과 5회 반복 측정에서 n_max 3이 평균 28.50 tok/s, 기준 대비 1.39배로 가장 좋았고, Q2_K_S와 Q8_0 Drafter의 성능 차이는 1–3%에 그쳤습니다. 반복·수학처럼 후보 채택률이 높은 작업은 n_max를 늘릴 때 이득이 있었지만 prose·번역·대화에서는 오히려 느려졌습니다. 실제 혼합 사용에서는 측정 조건 차이를 고려해 22–28 tok/s를 현실적인 범위로 제시했습니다.
실용적 조언
- Strix Halo에서 DeepSeek-V4-Flash-0731을 이미 사용한다면 먼저 Q2_K_S DSpark Drafter와 --spec-draft-n-max 3 조합을 기준 설정으로 삼을 수 있습니다. Q2_K_S는 Q8_0과 성능 차이가 1–3% 범위였지만 파일 크기는 6.45 GB로 Q8_0의 10.15 GB보다 작습니다. 다만 22–28 tok/s라는 혼합 사용 추정치는 sweep의 조건과 다르므로 실제 문맥 길이와 reasoning_effort 설정을 바꾼 뒤 다시 측정해야 합니다.
- 작업 유형에 따라 n_max를 고정하지 않는 편이 합리적입니다. repeat처럼 후보 채택률이 높은 작업은 n_max 5까지 40.17 tok/s가 나왔지만 prose와 translate에서는 n_max 2가 각각 23.38 tok/s와 25.09 tok/s로 가장 좋았습니다. code, json, math, dialog는 n_max 3에서 각각 28.99, 28.59, 31.22, 25.48 tok/s를 기록했으므로 혼합 작업의 출발점으로 n_max 3을 사용할 수 있습니다.
섹션별 상세
용어 해설
- 추측 디코딩(Speculative Decoding)
- — 작은 Drafter가 다음 토큰 후보를 먼저 생성하면 주 모델이 이를 한꺼번에 검증해 생성 단계를 줄이는 추론 기법입니다. 후보 수가 많이 채택되는 작업에서는 속도가 오르지만, 거부되는 후보가 많으면 추가 계산 때문에 오히려 느려질 수 있습니다.
- 프리필(Prefill)
- — 입력 프롬프트 전체를 주 모델에 넣어 첫 응답 토큰을 만들기 전까지 처리하는 단계입니다. 긴 입력을 병렬로 계산하므로 Decode보다 높은 처리량이 나오는 경우가 많으며, 이 글에서는 64k 입력에서 200–220 tok/s가 측정됐습니다.
- 디코드(Decode)
- — 이미 처리한 문맥을 바탕으로 응답 토큰을 한 개씩 생성하는 단계입니다. 생성 속도와 직접 연결되며, 작성자는 Drafter를 쓰지 않은 DeepSeek-V4-Flash-0731의 기준 속도로 20.48 tok/s를 사용했습니다.
- 통합 메모리(Unified Memory)
- — CPU와 GPU가 같은 메모리 공간을 공유하는 구조로, 모델 가중치와 추론 중간 데이터를 하나의 큰 메모리 풀에 배치할 수 있습니다. 이 측정에서는 128 GB Unified Memory를 갖춘 Strix Halo 미니 PC가 사용됐습니다.
- GGUF 모델 형식(GGUF)
- — llama.cpp 계열 추론 환경에서 양자화된 모델 가중치와 메타데이터를 저장하는 파일 형식입니다. 본문에서는 주 모델과 DSpark Drafter를 각각 GGUF 파일로 로드하며, Q2_K_S Drafter 파일 크기는 6.45 GB였습니다.
코드 예제
llama-server \
-m DeepSeek-V4-Flash-0731-UD-IQ3_XXS-q6kattn.gguf \
-a DeepSeek-V4-Flash-0731-UD-IQ3_XXS \
--no-ui -ngl 999 -c 131072 --jinja -fa 1 --port 9989 \
--no-mmap --no-warmup -np 1 \
--temp 0.9 --top-p 0.95 --min-p 0.01 --host 0.0.0.0 \
-ngld 999 -fit off \
-md DeepSeek-V4-Flash-0731-DSpark-Drafter-Q2_K_S-dflash.gguf \
--spec-type ngram-mod,draft-dspark --spec-draft-n-max 3 \
-ub 1024 --cache-ram 2048 \
--chat-template-kwargs '{"reasoning_effort":"max"}'DeepSeek-V4-Flash-0731에 Q2_K_S DSpark Drafter를 연결하고 n_max를 3으로 설정해 Strix Halo에서 추론을 실행하는 llama-server 명령입니다.
언급된 도구
GGUF 모델과 speculative decoding 설정을 실행하는 추론 프레임워크이며, 글에서는 Strix Halo용 fork와 upstream이 함께 연결됐습니다.
Strix Halo에서 FA와 MoE-prefill 수정, Mesa 번들, Vulkan/HIP 지원을 제공하는 llama.cpp fork입니다.
주 모델과 DSpark Drafter를 로드하고 ngram-mod 기반 speculative decoding을 실행하는 서버 명령입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.