본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

incoai/Qwen3.8-27B-DFlash2-GGUF

Qwen3.8-27B의 speculative decoding을 위한 병렬 draft token 생성apache-2.0

Qwen3.8-27B의 speculative decoding을 위해 토큰 블록을 병렬 초안 생성하는 DFlash 2 GGUF 모델입니다.

학습 방식 · Qwen/Qwen3.8-27B를 위한 DFlash 2 block-diffusion draft 구조로, 한 번의 병렬 처리에서 토큰 블록과 위치별 후보를 생성하도록 구성됐습니다. 별도의 학습 데이터나 세부 훈련 절차는 README에 기재되지 않았습니다.

TL;DR

이 저장소는 Qwen/Qwen3.8-27B를 위한 DFlash 2 draft 모델을 GGUF로 변환한 파생 모델이며, 단독 언어 모델이 아니라 speculative decoding server 안에서 target 모델이 검증할 토큰 초안을 생성합니다. DFlash 2는 block-diffusion 방식으로 한 번에 토큰 블록을 예측하고 각 위치의 top-16 후보에서 일관된 경로를 선택하며, 두 개의 dynamic convolution tap으로 블록 후반부의 품질 저하를 줄입니다. greedy decoding에서는 target 모델과 동일한 출력을 유지하고 sampling에서는 target 분포를 보존하도록 설계됐습니다. llama.cpp용 Q4_K_M, Q8_0, BF16 파일을 제공하며, GSM8K 첫 8개 예제 평가에서 acceptance length는 각각 5.39, 5.13, 5.28이었습니다.

핵심 포인트

  • Qwen3.8-27B의 출력을 대신하지 않고 검증용 초안 토큰을 생성하는 GGUF draft 모델입니다.
  • DFlash 2는 한 번에 토큰 블록을 예측한 뒤 후보 경로를 선택해 순차 생성을 줄입니다.
  • 두 개의 dynamic convolution tap이 블록 후반부의 draft 품질 저하를 완화합니다.
  • Q4_K_M, Q8_0, BF16 형식으로 제공되어 llama.cpp 환경에 맞춰 메모리를 선택합니다.

제한사항

  • 이 모델은 standalone language model이 아니라 Qwen3.8-27B가 생성한 결과를 검증받기 위한 speculative decoding용 draft 모델입니다. 따라서 target 모델과 draft 모델을 함께 speculative decoding server에 연결해야 하며, 단독으로 일반적인 text-generation 요청을 처리할 수 없습니다. README의 llama.cpp 예시는 DFlash 2 지원 PR을 적용한 빌드와 `--spec-type draft-dflash` 설정을 요구합니다.
  • 성능 평가는 Qwen3.8-27B Q4_K_M target과 GSM8K 테스트 첫 8개 예제, 최대 2048 new tokens, `xhigh` reasoning effort 조건에 한정됩니다. 측정 지표인 acceptance length는 completion tokens를 verification steps로 나눈 요청별 평균이므로 일반적인 정답률이나 target 모델의 품질을 뜻하지 않습니다. 더 넓은 태스크와 실제 서비스 부하에서의 처리량은 README 수치만으로 판단하기 어렵습니다.

벤치마크

벤치마크지표비교
Acceptance Length평균 completion tokens ÷ verification steps5.39Q4_K_M draft GGUF의 저장소 평가값이며, BF16 5.28과 Q8_0 5.13보다 높습니다. Qwen3.8-27B target 자체의 성능 수치가 아닙니다.
Acceptance Length평균 completion tokens ÷ verification steps5.13Q8_0 draft GGUF의 저장소 평가값이며, BF16 5.28과 Q4_K_M 5.39보다 낮습니다. Qwen3.8-27B target 자체의 성능 수치가 아닙니다.
Acceptance Length평균 completion tokens ÷ verification steps5.28BF16 draft GGUF의 저장소 평가값이며, Q8_0 5.13보다 높고 Q4_K_M 5.39보다 낮습니다. Qwen3.8-27B target 자체의 성능 수치가 아닙니다.

이미지 분석

DFlash 2가 입력의 mask token을 병렬 경로로 처리해 후보 토큰을 만들고, 선택된 하나의 경로를 target 모델 검증 단계로 전달하는 구조도입니다.
그림은 DFlash 2 Backbone이 Attention과 MLP를 거쳐 여러 위치의 후보를 동시에 만들고, Parallel Path Selector가 각 위치의 top-16 후보 사이에서 하나의 연속 경로를 고르는 흐름을 나타냅니다. 색상은 target-decoded token, mask token, drafted candidate, candidate, dynamic short convolution, selected path를 구분하며, 블록 단위 초안 생성과 경로 선택이 순차 decoding을 보조하는 방식을 드러냅니다. 이 구조는 draft가 블록 뒤쪽에서 약해지는 문제를 dynamic short convolution으로 보완하면서 target 모델의 검증 가능한 초안을 만드는 데 초점이 있습니다.

95

Likes

26.1k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.