본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

incoai/GLM-5.3-Flash-DFlash2

텍스트 생성 (추론 가속을 위한 Speculative Decoding 드래프트 모델)cc-by-nc-nd-4.0

GLM-5.3-Flash 모델을 위한 Speculative Decoding 드래프트 모델로, Block-Diffusion 기법을 통해 추론 처리량을 최대 2.79배 향상시킨다.

학습 방식 · zai-org/GLM-5.3-Flash 기반의 Block-Diffusion 드래프트 모델로, 추론 시 Speculative Decoding을 통해 타겟 모델의 토큰을 미리 생성함.

TL;DR

incoai/GLM-5.3-Flash-DFlash2는 zai-org/GLM-5.3-Flash 모델의 추론 속도를 높이기 위한 Speculative Decoding 전용 드래프트 모델이다. 이 모델은 Block-Diffusion 기법을 사용하여 한 번에 토큰 블록을 예측하고, Two-tap dynamic convolution으로 생성 경로의 일관성을 유지한다. SGLang 환경에서 기존 Autoregressive 방식이나 MTP 대비 높은 토큰 수용 길이와 처리량을 제공하여, 특히 대규모 추론 환경에서 효율적인 가속을 지원한다.

핵심 포인트

  • zai-org/GLM-5.3-Flash 전용 Speculative Decoding 드래프트 모델로, 단독 실행이 아닌 타겟 모델의 추론 속도를 높이는 보조 역할을 수행함.
  • Block-Diffusion 기법을 통해 토큰 블록을 한 번에 예측하며, Two-tap dynamic convolution으로 생성 경로의 일관성을 유지해 품질 저하를 방지함.
  • SGLang 환경에서 기존 Autoregressive 방식 대비 최대 2.79배의 처리량 향상과 더 긴 토큰 수용 길이를 제공하여 추론 효율을 극대화함.

제한사항

  • 단독으로 실행할 수 없는 보조 모델이며, 반드시 zai-org/GLM-5.3-Flash와 함께 사용해야 함.
  • SGLang 환경에서의 Speculative Decoding 구성을 필요로 함.

벤치마크

벤치마크지표비교
GSM8Kacceptance length5.78vs MTP: 5.06
MATH-500throughput (concurrency 1)438.9 tok/svs Autoregressive: 157.5 tok/s
HumanEvalthroughput (concurrency 32)4,198.4 tok/svs Autoregressive: 2,089.8 tok/s

78

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.