z-lab/Qwen3.8-27B-DFlash2
Qwen3.8-27B의 speculative decoding을 위한 draft modelapache-2.0
Qwen3.8-27B용 병렬 speculative decoding draft model로 GSM8K에서 3.43배 처리량을 기록했습니다.
학습 방식 · Qwen/Qwen3.8-27B를 target model로 사용하는 DFlash 2 block-diffusion draft 구조이며, 한 번에 토큰 블록을 생성한 뒤 후보 경로 선택과 target model 검증을 결합합니다.
TL;DR
Qwen3.8-27B-DFlash2는 Qwen/Qwen3.8-27B를 위한 DFlash 2 draft model로, 독립 실행 대신 speculative decoding 서버에서 target model이 검증할 토큰 블록을 생성합니다. Block-diffusion 방식으로 여러 위치의 후보를 한 번에 만들고 Parallel Path Selector가 하나의 일관된 경로를 고르며, dynamic short convolution이 블록 후반의 초안 품질 저하를 줄입니다. README 평가에서는 H200 한 장과 SGLang 환경에서 GSM8K acceptance length 5.46을 기록했고, 동시성 1 기준 236.1 output tok/s로 autoregressive 대비 3.43× throughput을 냈습니다. SGLang이나 vLLM 설정이 필요하고, 공개 성능은 특정 하드웨어와 디코딩 조건에서 측정된 값입니다.
핵심 포인트
- Qwen3.8-27B-DFlash2는 Qwen/Qwen3.8-27B를 검증 모델로 사용하는 DFlash 2 draft model입니다. 독립적으로 문장을 완성하지 않고 speculative decoding 서버 안에서 다음 토큰 후보를 생성합니다. 따라서 일반적인 text-generation 모델처럼 단독 배포하는 용도가 아닙니다.
- DFlash 2는 한 번의 추론으로 여러 토큰 블록을 병렬 생성하고 각 위치의 상위 후보를 보존합니다. 경량 Parallel Path Selector가 후보 사이의 일관된 경로를 선택해 검증 단계에 전달합니다. 이 구조는 토큰을 하나씩 예측하는 autoregressive decoding의 반복 횟수를 줄이는 데 초점을 둡니다.
- Backbone은 Attention과 MLP를 포함한 DFlash2 구조에 두 개의 dynamic short convolution을 추가합니다. 이 convolution은 블록 후반으로 갈수록 draft 품질이 약해지는 현상을 줄이는 역할을 합니다. Greedy decoding에서는 target model과 동일한 출력을 유지하고 sampling에서는 target model의 분포를 보존하도록 설계됐습니다.
- README의 단일 NVIDIA H200 평가에서 DFlash 2는 모든 비교 과제의 acceptance length와 throughput에서 MTP 및 DSpark보다 높은 수치를 기록했습니다. 동시성 1에서는 GSM8K 기준 236.1 output tok/s와 autoregressive 대비 3.43× speedup을 달성했습니다. 동시성 32에서도 GSM8K 1,922.5 output tok/s와 1.45× speedup을 기록해 높은 동시성에서 속도 이점이 줄어들면서도 유지됐습니다.
제한사항
- 이 저장소의 모델은 standalone language model이 아니며 speculative decoding 서버 안에서만 draft model로 작동합니다. SGLang 또는 vLLM에서 Qwen/Qwen3.8-27B를 target model로 함께 실행하고 DFLASH 설정과 draft model 경로를 지정해야 합니다. 일반 Transformers text-generation 파이프라인에 단독 모델로 연결하는 사용 방식은 README에 제시되지 않았습니다.
- 성능 수치는 SGLang, NVIDIA H200 한 장, FlashAttention 3, 블록 크기 8, 최대 생성 토큰 4096이라는 조건에서 측정됐습니다. 샘플링 설정은 temperature 1.0, top-p 0.95, top-k 20, xhigh reasoning effort로 고정됐습니다. 다른 GPU, 서버 엔진, 동시성, 생성 설정에서는 acceptance length와 throughput이 달라질 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Acceptance Length · GSM8K | completion tokens ÷ verification steps | 5.46 | Qwen3.8의 built-in MTP 5.02, DSpark 4.36 대비 높은 README 공개 수치 |
| Acceptance Length · MATH-500 | completion tokens ÷ verification steps | 5.28 | MTP 4.72, DSpark 3.92 대비 높은 README 공개 수치 |
| Acceptance Length · HumanEval | completion tokens ÷ verification steps | 4.39 | MTP 3.91, DSpark 3.30 대비 높은 README 공개 수치 |
| Throughput · GSM8K · concurrency 1 | output tok/s | 236.1 (3.43×) | Autoregressive 68.9, MTP 178.5 (2.59×), DSpark 185.3 (2.69×) 대비 높은 README 공개 수치 |
| Throughput · GSM8K · concurrency 8 | output tok/s | 1,328.7 (2.84×) | Autoregressive 467.2, MTP 1,022.1 (2.19×), DSpark 1,040.8 (2.23×) 대비 높은 README 공개 수치 |
| Throughput · GSM8K · concurrency 32 | output tok/s | 1,922.5 (1.45×) | Autoregressive 1,329.8, MTP 1,381.1 (1.04×), DSpark 1,506.5 (1.13×) 대비 높은 README 공개 수치 |
| Throughput · MT-Bench · concurrency 32 | output tok/s | 1,525.3 (1.01×) | Autoregressive 1,507.4, MTP 1,159.7 (0.77×), DSpark 1,115.5 (0.74×) 대비 높은 README 공개 수치 |
이미지 분석

108
Likes
1k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.