추론 속도를 극대화하는 블록 확산 기반 Speculative Decoding, DFlash
Infrastructure·Python1 / 0
DFlash는 블록 확산(Block Diffusion) 메커니즘을 활용하여 LLM의 병렬 드래프팅 품질과 추론 속도를 혁신적으로 높이는 경량 Speculative Decoding 프레임워크입니다.
주요 기능
- 블록 확산 모델을 통한 고품질 병렬 드래프트 토큰 생성
- vLLM 및 SGLang 서빙 엔진과의 네이티브 통합 지원
- Apple Silicon 환경을 위한 MLX 기반 최적화 구현체 제공
- 슬라이딩 윈도우 KV 캐시를 통한 롱 컨텍스트 추론 효율화
- Qwen3, Llama-3.1 등 최신 오픈소스 LLM 가속 모델 제공
어떻게 동작하는가
경량화된 블록 확산 모델이 여러 토큰을 동시에 예측하여 드래프트 시퀀스를 구성하고, 타겟 LLM이 Flash Attention 등을 활용해 이를 병렬로 검증하여 토큰 생성당 추론 횟수를 줄입니다. 특히 vLLM의 speculative-config나 SGLang의 DFLASH 알고리즘 옵션을 통해 기존 인프라에 즉시 적용되는 구조입니다.
3.5k
Stars
245
Forks
+386
Trending
1
조회수
3.5k watchers51 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.