본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

LilaRest/gemma-4-31B-it-NVFP4-turbo

텍스트 생성 및 대화형 AI31Bapache-2.0

Google의 Gemma 4 31B 모델을 NVIDIA ModelOpt를 통해 NVFP4 포맷으로 양자화하여 vLLM 환경에서 초고속 추론이 가능하도록 최적화한 모델이다.

학습 방식 · Google Gemma 4 31B IT 기반, NVIDIA ModelOpt를 활용한 NVFP4 4비트 양자화 및 추론 최적화

핵심 포인트

  • NVFP4 포맷 적용으로 FP8 대비 높은 추론 효율성 확보
  • 31B 규모 모델을 4비트 양자화로 메모리 점유율 최적화
  • vLLM 지원을 통한 엔터프라이즈급 서빙 가능
  • 멀티턴 대화 수행

254

LIKES

157.9k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.