LilaRest/gemma-4-31B-it-NVFP4-turbo
텍스트 생성 및 대화형 AI31Bapache-2.0
Google의 Gemma 4 31B 모델을 NVIDIA ModelOpt를 통해 NVFP4 포맷으로 양자화하여 vLLM 환경에서 초고속 추론이 가능하도록 최적화한 모델이다.
학습 방식 · Google Gemma 4 31B IT 기반, NVIDIA ModelOpt를 활용한 NVFP4 4비트 양자화 및 추론 최적화
핵심 포인트
- NVFP4 포맷 적용으로 FP8 대비 높은 추론 효율성 확보
- 31B 규모 모델을 4비트 양자화로 메모리 점유율 최적화
- vLLM 지원을 통한 엔터프라이즈급 서빙 가능
- 멀티턴 대화 수행
254
LIKES
157.9k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.