본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

z-lab/Qwen3.8-27B-DFlash2

Qwen3.8-27B의 speculative decoding을 위한 draft modelapache-2.0

Qwen3.8-27B용 병렬 speculative decoding draft model로 GSM8K에서 3.43배 처리량을 기록했습니다.

학습 방식 · Qwen/Qwen3.8-27B를 target model로 사용하는 DFlash 2 block-diffusion draft 구조이며, 한 번에 토큰 블록을 생성한 뒤 후보 경로 선택과 target model 검증을 결합합니다.

TL;DR

Qwen3.8-27B-DFlash2는 Qwen/Qwen3.8-27B를 위한 DFlash 2 draft model로, 독립 실행 대신 speculative decoding 서버에서 target model이 검증할 토큰 블록을 생성합니다. Block-diffusion 방식으로 여러 위치의 후보를 한 번에 만들고 Parallel Path Selector가 하나의 일관된 경로를 고르며, dynamic short convolution이 블록 후반의 초안 품질 저하를 줄입니다. README 평가에서는 H200 한 장과 SGLang 환경에서 GSM8K acceptance length 5.46을 기록했고, 동시성 1 기준 236.1 output tok/s로 autoregressive 대비 3.43× throughput을 냈습니다. SGLang이나 vLLM 설정이 필요하고, 공개 성능은 특정 하드웨어와 디코딩 조건에서 측정된 값입니다.

핵심 포인트

  • Qwen3.8-27B-DFlash2는 Qwen/Qwen3.8-27B를 검증 모델로 사용하는 DFlash 2 draft model입니다. 독립적으로 문장을 완성하지 않고 speculative decoding 서버 안에서 다음 토큰 후보를 생성합니다. 따라서 일반적인 text-generation 모델처럼 단독 배포하는 용도가 아닙니다.
  • DFlash 2는 한 번의 추론으로 여러 토큰 블록을 병렬 생성하고 각 위치의 상위 후보를 보존합니다. 경량 Parallel Path Selector가 후보 사이의 일관된 경로를 선택해 검증 단계에 전달합니다. 이 구조는 토큰을 하나씩 예측하는 autoregressive decoding의 반복 횟수를 줄이는 데 초점을 둡니다.
  • Backbone은 Attention과 MLP를 포함한 DFlash2 구조에 두 개의 dynamic short convolution을 추가합니다. 이 convolution은 블록 후반으로 갈수록 draft 품질이 약해지는 현상을 줄이는 역할을 합니다. Greedy decoding에서는 target model과 동일한 출력을 유지하고 sampling에서는 target model의 분포를 보존하도록 설계됐습니다.
  • README의 단일 NVIDIA H200 평가에서 DFlash 2는 모든 비교 과제의 acceptance length와 throughput에서 MTP 및 DSpark보다 높은 수치를 기록했습니다. 동시성 1에서는 GSM8K 기준 236.1 output tok/s와 autoregressive 대비 3.43× speedup을 달성했습니다. 동시성 32에서도 GSM8K 1,922.5 output tok/s와 1.45× speedup을 기록해 높은 동시성에서 속도 이점이 줄어들면서도 유지됐습니다.

제한사항

  • 이 저장소의 모델은 standalone language model이 아니며 speculative decoding 서버 안에서만 draft model로 작동합니다. SGLang 또는 vLLM에서 Qwen/Qwen3.8-27B를 target model로 함께 실행하고 DFLASH 설정과 draft model 경로를 지정해야 합니다. 일반 Transformers text-generation 파이프라인에 단독 모델로 연결하는 사용 방식은 README에 제시되지 않았습니다.
  • 성능 수치는 SGLang, NVIDIA H200 한 장, FlashAttention 3, 블록 크기 8, 최대 생성 토큰 4096이라는 조건에서 측정됐습니다. 샘플링 설정은 temperature 1.0, top-p 0.95, top-k 20, xhigh reasoning effort로 고정됐습니다. 다른 GPU, 서버 엔진, 동시성, 생성 설정에서는 acceptance length와 throughput이 달라질 수 있습니다.

벤치마크

벤치마크지표비교
Acceptance Length · GSM8Kcompletion tokens ÷ verification steps5.46Qwen3.8의 built-in MTP 5.02, DSpark 4.36 대비 높은 README 공개 수치
Acceptance Length · MATH-500completion tokens ÷ verification steps5.28MTP 4.72, DSpark 3.92 대비 높은 README 공개 수치
Acceptance Length · HumanEvalcompletion tokens ÷ verification steps4.39MTP 3.91, DSpark 3.30 대비 높은 README 공개 수치
Throughput · GSM8K · concurrency 1output tok/s236.1 (3.43×)Autoregressive 68.9, MTP 178.5 (2.59×), DSpark 185.3 (2.69×) 대비 높은 README 공개 수치
Throughput · GSM8K · concurrency 8output tok/s1,328.7 (2.84×)Autoregressive 467.2, MTP 1,022.1 (2.19×), DSpark 1,040.8 (2.23×) 대비 높은 README 공개 수치
Throughput · GSM8K · concurrency 32output tok/s1,922.5 (1.45×)Autoregressive 1,329.8, MTP 1,381.1 (1.04×), DSpark 1,506.5 (1.13×) 대비 높은 README 공개 수치
Throughput · MT-Bench · concurrency 32output tok/s1,525.3 (1.01×)Autoregressive 1,507.4, MTP 1,159.7 (0.77×), DSpark 1,115.5 (0.74×) 대비 높은 README 공개 수치

이미지 분석

DFlash 2가 마스킹된 토큰 블록에서 여러 위치의 후보를 병렬 생성하고 선택 경로를 구성하는 처리 흐름을 나타낸 도식입니다.
이미지는 입력 블록의 일부 토큰을 mask token으로 두고 DFlash2 Backbone이 Attention, MLP, Target LM Head를 거쳐 후보를 만드는 구조를 보여줍니다. 각 위치에서 상위 16개 후보를 유지한 뒤 Parallel Path Selector가 연관 경로를 따라 하나의 초안 경로를 선택하며, dynamic short convolution이 Backbone 내부에 배치됩니다. 이 병렬 블록 초안과 경로 선택이 DFlash 2의 speculative decoding 처리 방식과 직접 연결됩니다.

108

Likes

1k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.