본문으로 건너뛰기

Qwen3.8-27B, DFlash2로 31.4 t/s

DFlash2와 Q5_K_XL 조합이 Qwen3.8-27B의 디코드를 80W에서 31.4 t/s까지 높였습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Ryzen AI Max+ 395와 Radeon 8060S를 탑재한 Flow Z13에서 Qwen3.8-27B는 DFlash2와 Q5_K_XL 조합으로 80W 기준 31.4 t/s 디코드와 3k 입력 약 300 t/s Prefill을 기록했습니다. DFlash2는 내장 MTP보다 디코드 속도를 40% 높였고, Q5의 초안 수락률이 55.9%로 Q4의 44.9%보다 높아 추가 가중치 대역폭에도 Q5가 더 빠르게 작동했습니다. Q5_K_XL의 Perplexity는 53.85로 Q4_K_XL 57.26과 ROCmFP4_FAST 59.06보다 낮았으며, 128GB 메모리에서는 f16 KV를 유지하는 구성이 권장됩니다. 다만 DFlash2는 아직 gfx1151 CI가 없는 dev 빌드에 한정되고 DSpark 경로와 일부 FP4 엔진에는 구현 및 안정성 문제가 남아 있습니다.

주요 논점

01찬성소수

DFlash2는 Qwen3.8-27B의 Dense 디코드에서 내장 MTP보다 높은 속도를 내며, Q5_K_XL은 더 높은 초안 수락률 덕분에 Q4_K_XL보다 빠르고 Perplexity도 낮았습니다.

02찬성소수

Nathan의 Vulkan fork와 Flash Attention 계열 Prefill 최적화는 32k와 64k 같은 긴 컨텍스트에서 처리량을 크게 높였으며, f16 KV를 유지할 충분한 메모리가 있는 환경에서 실용성이 높습니다.

03반대소수

DFlash2 지원이 아직 검증된 정식 릴리스가 아니라 gfx1151 CI도 없고, FP4 엔진과 DSpark 경로에도 충돌 또는 구현 문제가 있어 운영 환경에 바로 적용하기에는 위험이 남아 있습니다.

합의점 vs 논쟁점

논쟁점

  • Q5_K_XL이 Q4_K_XL보다 빠르다는 결과는 양자화 모델의 일반적인 대역폭 직관과 반대이며, DFlash2 초안 모델과 대상 모델 사이의 수락률 정합성에 의존합니다.
  • DFlash2는 자동화된 dev 빌드에서만 제공되고 gfx1151 CI가 없으므로, 측정 결과가 안정적이어도 정식 배포 환경의 호환성은 별도로 검증해야 합니다.
  • Dense Qwen3.8-27B의 약 300 t/s Prefill과 Qwen3-Coder-30B-A3B의 약 1900 t/s Prefill 사이에는 큰 차이가 있어, 긴 프롬프트와 짧은 답변에는 MoE 구성이 더 적합할 수 있습니다.

실용적 조언

  • Flow Z13에서 실행할 때는 Qwen3.8-27B-UD-Q5_K_XL과 incoai DFlash2 Q4_K_M, n-max 7, f16 KV, ubatch 4096, Nathan의 Vulkan fork 조합을 우선 시도할 수 있습니다.
  • DFlash2가 포함된 dev-20260819-0b0f35d 또는 이후 버전을 정확히 고정하고, 정식 v0.x 릴리스가 나오기 전에는 실제 서비스 투입 전에 재검증해야 합니다.
  • 벤치마크는 첫 실행 결과를 버리고 동일 작업을 한 번 더 수행해야 합니다. DFlash2 초안 모델이 요청 사이에서 워밍업되면서 첫 실행 24.1 t/s가 워밍업 후 27.2 t/s 이상으로 변할 수 있습니다.
  • 128GB 메모리에서 21GB Dense 모델을 실행할 때는 컨텍스트 품질을 위해 KV 캐시를 q8_0으로 낮추지 말고 ctk f16과 ctv f16을 유지하는 편이 적합합니다.
  • 긴 Prefill에서는 ubatch 4096을 사용해야 하며, 2048은 약 5%의 처리량을 잃고 8192는 측정상 추가 이득이 없었습니다.

섹션별 상세

작성자는 Ryzen AI Max+ 395, Radeon 8060S, 128GB 메모리를 탑재한 Flow Z13에서 Qwen3.8-27B를 실행하고, Dense 27B 모델은 모든 토큰마다 27B 파라미터를 계산하므로 추측 디코딩이 사실상 핵심 속도 개선 수단이라고 정리했습니다. DFlash2는 초안 토큰 블록을 병렬로 만들고 대상 모델이 검증하는 방식으로 일반 디코드 약 14 t/s를 27.3~31.4 t/s로 끌어올렸습니다. 70W에서 30.2 t/s, 80W에서 31.4 t/s가 측정돼 이 하드웨어에서 에이전트 코딩용 로컬 실행 구성이 실용적인 수준에 도달했다는 결론으로 이어집니다.
DFlash2는 모델 내장 MTP보다 디코드 속도가 40% 높았고, 70W에서 21.6 t/s였던 MTP가 DFlash2 Q5 구성에서는 30.2 t/s로 증가했습니다. rejection sampling을 사용하므로 출력은 일반 추론과 동일하며, 초안 수락률은 DFlash2 Q4에서 44.9%, Q5에서 55.9%였습니다. 작성자는 네 가지 작업의 수락률이 모두 같은 방향으로 움직였다는 점을 근거로 이 차이가 우연이 아니라 대상 모델과 초안 모델의 분포 정합성에서 비롯된 구조적 결과라고 판단했습니다.
bash
llama-server \
-m Qwen3.8-27B-UD-Q5_K_XL.gguf \
-md Qwen3.8-27B-DFlash2-Q4_K_M.gguf \
-ngl all -ngld all -fa on \
-ctk f16 -ctv f16 \
-c 65536 -np 1 \
-b 4096 -ub 4096 \
-t 16 -tb 32 \
--spec-type draft-dflash --spec-draft-n-max 7 \
--jinja --host 127.0.0.1 --port 8080 --metrics

Qwen3.8-27B 양자화 모델과 DFlash2 초안 모델을 Vulkan 기반 llama-server에서 추측 디코딩으로 실행하는 명령입니다.

일반적인 양자화 직관과 달리 DFlash2를 사용할 때는 Q5_K_XL이 Q4_K_XL보다 빠르게 디코드됐습니다. Q5는 추가 가중치 대역폭을 요구하지만 수락률이 44.9%에서 55.9%로 높아져 패스당 채택 토큰 수가 늘었고, 80W 기준 Q4 28.5 t/s보다 Q5 31.4 t/s를 기록했습니다. 동시에 짧은 wikitext-2 평가에서 Perplexity도 Q5 53.85, Q4 57.26으로 Q5가 낮아 속도와 품질 모두에서 권장 구성이 뒤집혔습니다.
Prefill은 DFlash2와 MTP가 3k 입력에서 약 298~302 t/s로 비슷했지만, 64k 컨텍스트에서는 f16 KV와 ubatch 4096 설정이 중요한 차이를 만들었습니다. Q5의 Prefill은 32k에서 251.5 t/s, 64k에서 212.2 t/s였고, Nathan의 Flash Attention 계열 최적화를 ROCmFPX에 이식하자 32k에서 165 t/s가 263 t/s로 59% 증가했습니다. 반대로 수정되지 않은 엔진은 64k f16 KV에서 vk::DeviceLostError를 반복해 긴 컨텍스트 실행에서는 엔진 구현 자체가 병목이 됐습니다.
ROCmFP4 구성은 MTP 시대 설정의 21.6 t/s보다 빠른 23 t/s를 기록했지만, Q5와 DFlash2 조합의 30.2 t/s에는 미치지 못했습니다. 동일 엔진과 동일 방법으로 측정한 Perplexity는 ROCmFP4_FAST 59.06으로 Q4_K_XL 57.26보다 한 단계 나빴고, 64k f16 KV에서 사전 빌드가 충돌하는 문제도 있었습니다. 작성자는 FP4를 일회성 데모로 평가하고, 128GB 메모리에서는 f16 KV를 유지하는 Q5 구성과 검증된 엔진을 일상 실행에 권장했습니다.
llama.cpp의 DSpark 초안 경로는 이 모델에서 초안 수락률이 15~16%에 그쳐 속도 향상이 없었으며, 작성자는 GGUF 메타데이터를 확인하고 문제를 llama.cpp의 DSpark 초안 생성 과정으로 좁혔습니다. 따라서 현재는 DSpark 대신 MTP 또는 DFlash2를 사용해야 하며, DFlash2가 포함된 빌드는 자동화된 dev 라인인 dev-20260819-0b0f35d와 이후 버전에 한정됩니다. 첫 실행은 초안 모델이 워밍업되지 않아 24.1 t/s에 그쳤고 동일 설정의 워밍업 실행은 27.2 t/s 이상이었으므로 벤치마크를 두 번 수행해야 수치를 비교할 수 있습니다.

용어 해설

추측 디코딩(Speculative Decoding)
작은 초안 모델이 다음 토큰 후보를 먼저 병렬 생성하고, 대상 모델이 이를 한 번에 검증해 채택하는 추론 방식입니다. 초안이 맞힌 토큰이 많을수록 대상 모델의 순차 계산을 건너뛰어 생성 속도가 빨라지며, 이 글에서는 DFlash2가 Qwen3.8-27B의 디코드 병목을 줄이는 핵심 수단으로 쓰였습니다.
Mixture of Experts
하나의 대형 모델 안에서 입력마다 일부 Expert만 선택해 계산하는 구조입니다. 전체 파라미터가 커도 활성 파라미터만 연산하므로 Dense 모델보다 토큰 처리량이 높을 수 있으며, 글에서는 300B 파라미터와 8.4B 활성 파라미터를 가진 MoE 모델과 27B Dense 모델의 차이를 비교하는 기준으로 사용됐습니다.
Perplexity
언어 모델이 텍스트의 다음 토큰을 얼마나 잘 예측하는지 나타내는 평가 지표로, 일반적으로 값이 낮을수록 예측 품질이 높습니다. 글에서는 wikitext-2 일부와 8,192 컨텍스트를 사용해 양자화 방식별 값을 비교했으며 Q5_K_XL 53.85, Q4_K_XL 57.26, ROCmFP4_FAST 59.06이 측정됐습니다.
Flash Attention
Attention 계산에서 중간 결과의 메모리 이동과 저장을 줄여 긴 입력의 Prefill을 빠르게 처리하는 최적화입니다. Nathan의 Vulkan fork는 한 번의 역양자화, KV 정렬, coopmat1 튜닝을 포함한 Prefill 최적화를 적용했으며, ROCmFPX에 이 변경을 이식한 결과 32k 입력에서 165 t/s가 263 t/s로 증가했습니다.

언급된 도구

Nathanw1014/strix-halo-llamacpp추천링크

AMD Strix Halo의 gfx1151 환경에서 Dense Prefill과 DFlash2를 지원하도록 튜닝된 llama.cpp fork입니다.

DFlash2추천링크

Qwen3.8-27B의 다음 토큰 후보를 초안 생성해 대상 모델의 순차 디코드 부담을 줄이는 drafter입니다.

llama.cpp중립링크

Qwen3.8-27B를 로컬에서 실행하고 MTP, DFlash2, DSpark 추론 경로를 제공하는 실행 프레임워크입니다.

ROCmFPX중립링크

Nathan의 Flash Attention Prefill 최적화를 이식해 긴 컨텍스트 Prefill 처리량을 비교한 Vulkan 기반 엔진입니다.

Qwen3.8-27B-UD-Q5_K_XL추천링크

본문의 주 실행 대상인 20.6GB Q5 양자화 모델입니다.

incoai/Qwen3.8-27B-DFlash2-GGUF추천링크

Qwen3.8-27B를 위한 1.1GB Q4_K_M DFlash2 초안 모델입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.