Qwen 3.6의 추론 속도를 극대화하는 블록 확산 기반 드래프트 모델 DFlash
텍스트 생성 가속화 (추측적 디코딩)27B (Target 기준)mit
블록 확산(Block Diffusion) 기법을 활용하여 Qwen 3.6 27B 모델의 추론 속도를 비약적으로 향상시키는 전용 드래프트 모델이다.
핵심 역량
- 병렬 토큰 드래프팅
- 추측적 디코딩 가속
- vLLM 및 SGLang 통합 지원
- 고성능 텍스트 생성 보조
강점
- 최대 15~16개의 추측 토큰(Speculative Tokens)을 동시에 생성하여 추론 속도 개선
- vLLM 및 SGLang 등 최신 추론 프레임워크와의 네이티브 통합 지원
훈련 방식
Qwen 3.6 27B 기반 블록 확산(Block Diffusion) 기법을 적용한 추측적 디코딩 특화 학습
알아두면 좋은 것
- 현재 학습 진행 중인 모델로 아키텍처 변경에 따라 일부 엔진 지원이 불안정할 수 있음
- 인과적 SWA(Sliding Window Attention) 레이어를 포함한 특수 구조 채택
- 단독 실행이 불가능하며 반드시 Qwen/Qwen3.6-27B 타겟 모델과 함께 사용해야 함
- MIT 라이선스로 배포되어 상업적 이용 및 수정이 자유로움
295
Likes
39k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.