z-lab/Qwen3.8-27B-DFlash2-GGUF
Qwen3.8-27B의 speculative decoding을 위한 draft token 생성27Bapache-2.0
Qwen3.8-27B의 speculative decoding을 가속하는 DFlash 2 draft 모델용 GGUF 변환본입니다.
TL;DR
이 모델은 Qwen3.8-27B를 위한 DFlash 2 speculative decoding draft 모델의 GGUF 변환본이며, 독립 실행형 언어 모델이 아닙니다. 한 번의 추론으로 토큰 블록 전체와 위치별 후보를 만들고, lightweight selector가 후보를 연결해 target model이 검증할 경로를 고릅니다. Backbone의 two-tap dynamic convolution은 블록 후반부에서 초안 품질이 떨어지는 현상을 줄이며, greedy decoding에서는 target model과 동일한 출력을 유지하고 sampling에서도 target model의 분포를 보존합니다. GSM8K 첫 8개 테스트 예제로 측정한 Acceptance Length는 Q4_K_M 5.39, BF16 5.28, Q8_0 5.13이었습니다.
핵심 포인트
- Qwen3.8-27B를 검증하는 DFlash 2 draft 모델입니다. 독립 실행형 언어 모델이 아닙니다. speculative decoding 서버 안에서만 작동합니다.
- 한 번의 추론으로 토큰 블록 전체를 초안으로 만듭니다. 각 위치의 후보를 보존합니다. selector가 후보를 연결해 하나의 경로를 고릅니다.
- BF16·Q8_0·Q4_K_M GGUF를 제공합니다. Q4_K_M 파일은 1.1 GB입니다. llama.cpp의 DFlash 2 지원 빌드가 필요합니다.
제한사항
- 독립적으로 텍스트를 생성하는 모델이 아닙니다. target model인 Qwen3.8-27B가 후보 토큰을 검증해야 합니다. 따라서 speculative decoding 서버와 호환되는 실행 환경이 필요합니다.
- README의 실행 절차는 llama.cpp PR #27342 기반입니다. CUDA 또는 Metal 옵션으로 llama.cpp를 직접 빌드해야 합니다. 다른 엔진의 세부 사용법은 블로그 안내를 따라야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Acceptance Length | completion tokens ÷ verification steps | BF16 5.28; Q8_0 5.13; Q4_K_M 5.39 | — |
이미지 분석

82
LIKES
26k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.