본문으로 건너뛰기

Strix Halo에서 DeepSeek-V4-Flash speculative decoding 측정

Strix Halo에서 DeepSeek-V4-Flash-0731은 Q2_K_S Drafter와 n_max 3 조합으로 평균 28.50 tok/s를 기록했다며 실사용 속도를 22–28 tok/s로 제시했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 128 GB Unified Memory를 탑재한 Strix Halo에서 DeepSeek-V4-Flash-0731과 두 DSpark Drafter의 speculative decoding 성능을 비교했습니다. 7개 작업 유형과 5회 반복 측정에서 n_max 3이 평균 28.50 tok/s, 기준 대비 1.39배로 가장 좋았고, Q2_K_S와 Q8_0 Drafter의 성능 차이는 1–3%에 그쳤습니다. 반복·수학처럼 후보 채택률이 높은 작업은 n_max를 늘릴 때 이득이 있었지만 prose·번역·대화에서는 오히려 느려졌습니다. 실제 혼합 사용에서는 측정 조건 차이를 고려해 22–28 tok/s를 현실적인 범위로 제시했습니다.

실용적 조언

  • Strix Halo에서 DeepSeek-V4-Flash-0731을 이미 사용한다면 먼저 Q2_K_S DSpark Drafter와 --spec-draft-n-max 3 조합을 기준 설정으로 삼을 수 있습니다. Q2_K_S는 Q8_0과 성능 차이가 1–3% 범위였지만 파일 크기는 6.45 GB로 Q8_0의 10.15 GB보다 작습니다. 다만 22–28 tok/s라는 혼합 사용 추정치는 sweep의 조건과 다르므로 실제 문맥 길이와 reasoning_effort 설정을 바꾼 뒤 다시 측정해야 합니다.
  • 작업 유형에 따라 n_max를 고정하지 않는 편이 합리적입니다. repeat처럼 후보 채택률이 높은 작업은 n_max 5까지 40.17 tok/s가 나왔지만 prose와 translate에서는 n_max 2가 각각 23.38 tok/s와 25.09 tok/s로 가장 좋았습니다. code, json, math, dialog는 n_max 3에서 각각 28.99, 28.59, 31.22, 25.48 tok/s를 기록했으므로 혼합 작업의 출발점으로 n_max 3을 사용할 수 있습니다.

섹션별 상세

01
작성자는 128 GB Unified Memory를 갖춘 Strix Halo 미니 PC에서 DeepSeek-V4-Flash-0731의 추론 속도를 일주일 동안 측정했습니다. 64k 문맥에서 Drafter 없이 Prefill은 200–220 tok/s, Decode는 20–22 tok/s였고 비교 기준은 20.48 tok/s로 고정했습니다. 264k 문맥에서는 Q6 attention을 포함한 UD-IQ3_XXS 모델 프로세스가 약 114 GB를 사용해 메모리 여유가 크지 않은 환경임이 드러났습니다.
02
DSpark Drafter의 Q8_0과 직접 양자화한 Q2_K_S를 n_max 2–7 범위에서 비교했습니다. 7개 프롬프트 유형에 대해 각 5회씩 실행하고 temp 0.9, top_p 0.95, min_p 0.01을 유지했으며, sweep에서는 ngram-mod를 꺼서 Drafter 자체의 효과만 측정했습니다. 두 Drafter는 모든 n_max와 범주에서 1–3% 안에 들어갔기 때문에 10.15 GB인 Q8_0보다 6.45 GB인 Q2_K_S가 실사용 선택으로 남았습니다.
03
전체 평균에서는 n_max 3이 28.50 tok/s로 기준보다 1.39배 빨랐고, n_max 2는 27.12 tok/s, n_max 4는 27.73 tok/s를 기록했습니다. n_max 5–7은 평균 약 26.4–26.5 tok/s와 accept 약 0.45로 떨어졌지만, 반복 작업에서는 40.17 tok/s와 1.96배 속도가 나왔고 수학에서는 n_max 3 기준 31.22 tok/s와 1.52배가 나왔습니다. 반대로 prose, translate, dialog처럼 후보 채택률이 낮은 작업에서는 긴 후보를 더 생성할수록 거부되는 토큰의 비용이 커져 n_max 2 또는 3이 유리했습니다.
04
작성자는 실제 일상 설정에서 128k 문맥, ngram-mod와 Drafter의 조합, reasoning_effort=max를 사용하지만 sweep은 64k 창과 실제 약 32k 사용량, draft-only, reasoning_effort=low 조건이었다고 구분했습니다. 따라서 28.5 tok/s를 모든 상황의 보장값으로 보지 않고 혼합 사용에서 22–28 tok/s를 현실적인 예산으로 잡았습니다. 본문 명령은 llama-server에서 --spec-type ngram-mod,draft-dspark와 --spec-draft-n-max 3을 함께 지정해 측정에서 유지한 설정을 재현하도록 구성됐습니다.

용어 해설

추측 디코딩(Speculative Decoding)
작은 Drafter가 다음 토큰 후보를 먼저 생성하면 주 모델이 이를 한꺼번에 검증해 생성 단계를 줄이는 추론 기법입니다. 후보 수가 많이 채택되는 작업에서는 속도가 오르지만, 거부되는 후보가 많으면 추가 계산 때문에 오히려 느려질 수 있습니다.
프리필(Prefill)
입력 프롬프트 전체를 주 모델에 넣어 첫 응답 토큰을 만들기 전까지 처리하는 단계입니다. 긴 입력을 병렬로 계산하므로 Decode보다 높은 처리량이 나오는 경우가 많으며, 이 글에서는 64k 입력에서 200–220 tok/s가 측정됐습니다.
디코드(Decode)
이미 처리한 문맥을 바탕으로 응답 토큰을 한 개씩 생성하는 단계입니다. 생성 속도와 직접 연결되며, 작성자는 Drafter를 쓰지 않은 DeepSeek-V4-Flash-0731의 기준 속도로 20.48 tok/s를 사용했습니다.
통합 메모리(Unified Memory)
CPU와 GPU가 같은 메모리 공간을 공유하는 구조로, 모델 가중치와 추론 중간 데이터를 하나의 큰 메모리 풀에 배치할 수 있습니다. 이 측정에서는 128 GB Unified Memory를 갖춘 Strix Halo 미니 PC가 사용됐습니다.
GGUF 모델 형식(GGUF)
llama.cpp 계열 추론 환경에서 양자화된 모델 가중치와 메타데이터를 저장하는 파일 형식입니다. 본문에서는 주 모델과 DSpark Drafter를 각각 GGUF 파일로 로드하며, Q2_K_S Drafter 파일 크기는 6.45 GB였습니다.

코드 예제

bash
llama-server \
  -m DeepSeek-V4-Flash-0731-UD-IQ3_XXS-q6kattn.gguf \
  -a DeepSeek-V4-Flash-0731-UD-IQ3_XXS \
  --no-ui -ngl 999 -c 131072 --jinja -fa 1 --port 9989 \
  --no-mmap --no-warmup -np 1 \
  --temp 0.9 --top-p 0.95 --min-p 0.01 --host 0.0.0.0 \
  -ngld 999 -fit off \
  -md DeepSeek-V4-Flash-0731-DSpark-Drafter-Q2_K_S-dflash.gguf \
  --spec-type ngram-mod,draft-dspark --spec-draft-n-max 3 \
  -ub 1024 --cache-ram 2048 \
  --chat-template-kwargs '{"reasoning_effort":"max"}'

DeepSeek-V4-Flash-0731에 Q2_K_S DSpark Drafter를 연결하고 n_max를 3으로 설정해 Strix Halo에서 추론을 실행하는 llama-server 명령입니다.

언급된 도구

llama.cpp중립링크

GGUF 모델과 speculative decoding 설정을 실행하는 추론 프레임워크이며, 글에서는 Strix Halo용 fork와 upstream이 함께 연결됐습니다.

strix-halo-llamacpp추천링크

Strix Halo에서 FA와 MoE-prefill 수정, Mesa 번들, Vulkan/HIP 지원을 제공하는 llama.cpp fork입니다.

llama-server중립

주 모델과 DSpark Drafter를 로드하고 ngram-mod 기반 speculative decoding을 실행하는 서버 명령입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.