TL;DR
Ryzen AI Max+ 395와 Radeon 8060S를 탑재한 Flow Z13에서 Qwen3.8-27B는 DFlash2와 Q5_K_XL 조합으로 80W 기준 31.4 t/s 디코드와 3k 입력 약 300 t/s Prefill을 기록했습니다. DFlash2는 내장 MTP보다 디코드 속도를 40% 높였고, Q5의 초안 수락률이 55.9%로 Q4의 44.9%보다 높아 추가 가중치 대역폭에도 Q5가 더 빠르게 작동했습니다. Q5_K_XL의 Perplexity는 53.85로 Q4_K_XL 57.26과 ROCmFP4_FAST 59.06보다 낮았으며, 128GB 메모리에서는 f16 KV를 유지하는 구성이 권장됩니다. 다만 DFlash2는 아직 gfx1151 CI가 없는 dev 빌드에 한정되고 DSpark 경로와 일부 FP4 엔진에는 구현 및 안정성 문제가 남아 있습니다.
주요 논점
DFlash2는 Qwen3.8-27B의 Dense 디코드에서 내장 MTP보다 높은 속도를 내며, Q5_K_XL은 더 높은 초안 수락률 덕분에 Q4_K_XL보다 빠르고 Perplexity도 낮았습니다.
Nathan의 Vulkan fork와 Flash Attention 계열 Prefill 최적화는 32k와 64k 같은 긴 컨텍스트에서 처리량을 크게 높였으며, f16 KV를 유지할 충분한 메모리가 있는 환경에서 실용성이 높습니다.
DFlash2 지원이 아직 검증된 정식 릴리스가 아니라 gfx1151 CI도 없고, FP4 엔진과 DSpark 경로에도 충돌 또는 구현 문제가 있어 운영 환경에 바로 적용하기에는 위험이 남아 있습니다.
합의점 vs 논쟁점
논쟁점
- Q5_K_XL이 Q4_K_XL보다 빠르다는 결과는 양자화 모델의 일반적인 대역폭 직관과 반대이며, DFlash2 초안 모델과 대상 모델 사이의 수락률 정합성에 의존합니다.
- DFlash2는 자동화된 dev 빌드에서만 제공되고 gfx1151 CI가 없으므로, 측정 결과가 안정적이어도 정식 배포 환경의 호환성은 별도로 검증해야 합니다.
- Dense Qwen3.8-27B의 약 300 t/s Prefill과 Qwen3-Coder-30B-A3B의 약 1900 t/s Prefill 사이에는 큰 차이가 있어, 긴 프롬프트와 짧은 답변에는 MoE 구성이 더 적합할 수 있습니다.
실용적 조언
- Flow Z13에서 실행할 때는 Qwen3.8-27B-UD-Q5_K_XL과 incoai DFlash2 Q4_K_M, n-max 7, f16 KV, ubatch 4096, Nathan의 Vulkan fork 조합을 우선 시도할 수 있습니다.
- DFlash2가 포함된 dev-20260819-0b0f35d 또는 이후 버전을 정확히 고정하고, 정식 v0.x 릴리스가 나오기 전에는 실제 서비스 투입 전에 재검증해야 합니다.
- 벤치마크는 첫 실행 결과를 버리고 동일 작업을 한 번 더 수행해야 합니다. DFlash2 초안 모델이 요청 사이에서 워밍업되면서 첫 실행 24.1 t/s가 워밍업 후 27.2 t/s 이상으로 변할 수 있습니다.
- 128GB 메모리에서 21GB Dense 모델을 실행할 때는 컨텍스트 품질을 위해 KV 캐시를 q8_0으로 낮추지 말고 ctk f16과 ctv f16을 유지하는 편이 적합합니다.
- 긴 Prefill에서는 ubatch 4096을 사용해야 하며, 2048은 약 5%의 처리량을 잃고 8192는 측정상 추가 이득이 없었습니다.
섹션별 상세
llama-server \
-m Qwen3.8-27B-UD-Q5_K_XL.gguf \
-md Qwen3.8-27B-DFlash2-Q4_K_M.gguf \
-ngl all -ngld all -fa on \
-ctk f16 -ctv f16 \
-c 65536 -np 1 \
-b 4096 -ub 4096 \
-t 16 -tb 32 \
--spec-type draft-dflash --spec-draft-n-max 7 \
--jinja --host 127.0.0.1 --port 8080 --metricsQwen3.8-27B 양자화 모델과 DFlash2 초안 모델을 Vulkan 기반 llama-server에서 추측 디코딩으로 실행하는 명령입니다.
용어 해설
- 추측 디코딩(Speculative Decoding)
- — 작은 초안 모델이 다음 토큰 후보를 먼저 병렬 생성하고, 대상 모델이 이를 한 번에 검증해 채택하는 추론 방식입니다. 초안이 맞힌 토큰이 많을수록 대상 모델의 순차 계산을 건너뛰어 생성 속도가 빨라지며, 이 글에서는 DFlash2가 Qwen3.8-27B의 디코드 병목을 줄이는 핵심 수단으로 쓰였습니다.
- Mixture of Experts
- — 하나의 대형 모델 안에서 입력마다 일부 Expert만 선택해 계산하는 구조입니다. 전체 파라미터가 커도 활성 파라미터만 연산하므로 Dense 모델보다 토큰 처리량이 높을 수 있으며, 글에서는 300B 파라미터와 8.4B 활성 파라미터를 가진 MoE 모델과 27B Dense 모델의 차이를 비교하는 기준으로 사용됐습니다.
- Perplexity
- — 언어 모델이 텍스트의 다음 토큰을 얼마나 잘 예측하는지 나타내는 평가 지표로, 일반적으로 값이 낮을수록 예측 품질이 높습니다. 글에서는 wikitext-2 일부와 8,192 컨텍스트를 사용해 양자화 방식별 값을 비교했으며 Q5_K_XL 53.85, Q4_K_XL 57.26, ROCmFP4_FAST 59.06이 측정됐습니다.
- Flash Attention
- — Attention 계산에서 중간 결과의 메모리 이동과 저장을 줄여 긴 입력의 Prefill을 빠르게 처리하는 최적화입니다. Nathan의 Vulkan fork는 한 번의 역양자화, KV 정렬, coopmat1 튜닝을 포함한 Prefill 최적화를 적용했으며, ROCmFPX에 이 변경을 이식한 결과 32k 입력에서 165 t/s가 263 t/s로 증가했습니다.
언급된 도구
AMD Strix Halo의 gfx1151 환경에서 Dense Prefill과 DFlash2를 지원하도록 튜닝된 llama.cpp fork입니다.
Qwen3.8-27B의 다음 토큰 후보를 초안 생성해 대상 모델의 순차 디코드 부담을 줄이는 drafter입니다.
Qwen3.8-27B를 로컬에서 실행하고 MTP, DFlash2, DSpark 추론 경로를 제공하는 실행 프레임워크입니다.
Nathan의 Flash Attention Prefill 최적화를 이식해 긴 컨텍스트 Prefill 처리량을 비교한 Vulkan 기반 엔진입니다.
본문의 주 실행 대상인 20.6GB Q5 양자화 모델입니다.
Qwen3.8-27B를 위한 1.1GB Q4_K_M DFlash2 초안 모델입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.