incoai/Qwen3.8-27B-DFlash2-GGUF
Qwen3.8-27B의 speculative decoding을 위한 병렬 draft token 생성apache-2.0
Qwen3.8-27B의 speculative decoding을 위해 토큰 블록을 병렬 초안 생성하는 DFlash 2 GGUF 모델입니다.
학습 방식 · Qwen/Qwen3.8-27B를 위한 DFlash 2 block-diffusion draft 구조로, 한 번의 병렬 처리에서 토큰 블록과 위치별 후보를 생성하도록 구성됐습니다. 별도의 학습 데이터나 세부 훈련 절차는 README에 기재되지 않았습니다.
TL;DR
이 저장소는 Qwen/Qwen3.8-27B를 위한 DFlash 2 draft 모델을 GGUF로 변환한 파생 모델이며, 단독 언어 모델이 아니라 speculative decoding server 안에서 target 모델이 검증할 토큰 초안을 생성합니다. DFlash 2는 block-diffusion 방식으로 한 번에 토큰 블록을 예측하고 각 위치의 top-16 후보에서 일관된 경로를 선택하며, 두 개의 dynamic convolution tap으로 블록 후반부의 품질 저하를 줄입니다. greedy decoding에서는 target 모델과 동일한 출력을 유지하고 sampling에서는 target 분포를 보존하도록 설계됐습니다. llama.cpp용 Q4_K_M, Q8_0, BF16 파일을 제공하며, GSM8K 첫 8개 예제 평가에서 acceptance length는 각각 5.39, 5.13, 5.28이었습니다.
핵심 포인트
- Qwen3.8-27B의 출력을 대신하지 않고 검증용 초안 토큰을 생성하는 GGUF draft 모델입니다.
- DFlash 2는 한 번에 토큰 블록을 예측한 뒤 후보 경로를 선택해 순차 생성을 줄입니다.
- 두 개의 dynamic convolution tap이 블록 후반부의 draft 품질 저하를 완화합니다.
- Q4_K_M, Q8_0, BF16 형식으로 제공되어 llama.cpp 환경에 맞춰 메모리를 선택합니다.
제한사항
- 이 모델은 standalone language model이 아니라 Qwen3.8-27B가 생성한 결과를 검증받기 위한 speculative decoding용 draft 모델입니다. 따라서 target 모델과 draft 모델을 함께 speculative decoding server에 연결해야 하며, 단독으로 일반적인 text-generation 요청을 처리할 수 없습니다. README의 llama.cpp 예시는 DFlash 2 지원 PR을 적용한 빌드와 `--spec-type draft-dflash` 설정을 요구합니다.
- 성능 평가는 Qwen3.8-27B Q4_K_M target과 GSM8K 테스트 첫 8개 예제, 최대 2048 new tokens, `xhigh` reasoning effort 조건에 한정됩니다. 측정 지표인 acceptance length는 completion tokens를 verification steps로 나눈 요청별 평균이므로 일반적인 정답률이나 target 모델의 품질을 뜻하지 않습니다. 더 넓은 태스크와 실제 서비스 부하에서의 처리량은 README 수치만으로 판단하기 어렵습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Acceptance Length | 평균 completion tokens ÷ verification steps | 5.39 | Q4_K_M draft GGUF의 저장소 평가값이며, BF16 5.28과 Q8_0 5.13보다 높습니다. Qwen3.8-27B target 자체의 성능 수치가 아닙니다. |
| Acceptance Length | 평균 completion tokens ÷ verification steps | 5.13 | Q8_0 draft GGUF의 저장소 평가값이며, BF16 5.28과 Q4_K_M 5.39보다 낮습니다. Qwen3.8-27B target 자체의 성능 수치가 아닙니다. |
| Acceptance Length | 평균 completion tokens ÷ verification steps | 5.28 | BF16 draft GGUF의 저장소 평가값이며, Q8_0 5.13보다 높고 Q4_K_M 5.39보다 낮습니다. Qwen3.8-27B target 자체의 성능 수치가 아닙니다. |
이미지 분석

95
Likes
26.1k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.