incoai/GLM-5.3-Flash-DFlash2
텍스트 생성 (추론 가속을 위한 Speculative Decoding 드래프트 모델)cc-by-nc-nd-4.0
GLM-5.3-Flash 모델을 위한 Speculative Decoding 드래프트 모델로, Block-Diffusion 기법을 통해 추론 처리량을 최대 2.79배 향상시킨다.
학습 방식 · zai-org/GLM-5.3-Flash 기반의 Block-Diffusion 드래프트 모델로, 추론 시 Speculative Decoding을 통해 타겟 모델의 토큰을 미리 생성함.
TL;DR
incoai/GLM-5.3-Flash-DFlash2는 zai-org/GLM-5.3-Flash 모델의 추론 속도를 높이기 위한 Speculative Decoding 전용 드래프트 모델이다. 이 모델은 Block-Diffusion 기법을 사용하여 한 번에 토큰 블록을 예측하고, Two-tap dynamic convolution으로 생성 경로의 일관성을 유지한다. SGLang 환경에서 기존 Autoregressive 방식이나 MTP 대비 높은 토큰 수용 길이와 처리량을 제공하여, 특히 대규모 추론 환경에서 효율적인 가속을 지원한다.
핵심 포인트
- zai-org/GLM-5.3-Flash 전용 Speculative Decoding 드래프트 모델로, 단독 실행이 아닌 타겟 모델의 추론 속도를 높이는 보조 역할을 수행함.
- Block-Diffusion 기법을 통해 토큰 블록을 한 번에 예측하며, Two-tap dynamic convolution으로 생성 경로의 일관성을 유지해 품질 저하를 방지함.
- SGLang 환경에서 기존 Autoregressive 방식 대비 최대 2.79배의 처리량 향상과 더 긴 토큰 수용 길이를 제공하여 추론 효율을 극대화함.
제한사항
- 단독으로 실행할 수 없는 보조 모델이며, 반드시 zai-org/GLM-5.3-Flash와 함께 사용해야 함.
- SGLang 환경에서의 Speculative Decoding 구성을 필요로 함.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GSM8K | acceptance length | 5.78 | vs MTP: 5.06 |
| MATH-500 | throughput (concurrency 1) | 438.9 tok/s | vs Autoregressive: 157.5 tok/s |
| HumanEval | throughput (concurrency 32) | 4,198.4 tok/s | vs Autoregressive: 2,089.8 tok/s |
78
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.