z-lab/gemma-4-31B-it-DFlash
텍스트 생성 및 추론 가속31Bapache-2.0
확산 언어 모델 기법과 투기적 디코딩을 결합하여 Gemma 모델의 추론 효율성을 극대화하는 초안 모델이다.
학습 방식 · Gemma 기반 아키텍처에 Block Diffusion 및 Speculative Decoding 기법을 적용하여 훈련됨
핵심 포인트
- 투기적 디코딩 적용 시 기존 순차 디코딩 대비 높은 추론 속도 달성
- 확산 모델 기반의 병렬 토큰 예측으로 디코딩 효율성 확보
- 투기적 디코딩을 통한 추론 가속
- 블록 단위 병렬 토큰 생성
81
LIKES
10.1k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.