본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

antirez/deepseek-v4-gguf

텍스트 생성 (양자화된 로컬 추론용 GGUF 배포)mit

DeepSeek-V4-Flash를 ds4 추론엔진용 GGUF로 양자화해 로컬 머신에서 구동할 수 있게 만든 배포판.

TL;DR

이 저장소는 DeepSeek AI의 DeepSeek-V4-Flash MoE 언어모델을 antirez의 ds4 추론 엔진에 맞춰 GGUF로 양자화한 배포판으로, 라우팅 전문가(gate/up/down)만 IQ2_XXS·Q2_K 또는 Q4_K로 압축하고 어텐션·공유 전문가·출력층은 Q8_0로 유지해 정확도 손실을 최소화하는 비대칭 양자화 전략을 쓴다. q2 파일은 80.8GiB로 128GB RAM Mac에서, q4 파일은 153.3GiB로 256GB 이상 RAM 머신에서 구동하도록 설계됐고, 추측 디코딩용 MTP 보조 파일(3.6GiB)도 함께 제공한다. ds4를 클론해 다운로드 스크립트로 원하는 정밀도를 받은 뒤 바로 로컬 추론이나 서버 실행이 가능해, 대형 MoE 모델을 워크스테이션급 메모리에서 돌리려는 용도에 적합하다.

핵심 포인트

  • 라우팅 전문가만 2~4bit로 압축하고 어텐션·공유 전문가·출력층은 Q8_0로 유지해 품질 손실을 줄였다.
  • 128GB RAM Mac용 q2(80.8GiB)와 256GB 이상용 q4(153.3GiB) 두 정밀도를 함께 제공한다.
  • 추측 디코딩용 MTP 보조 GGUF(3.6GiB)를 별도로 제공해 지원 시 응답 속도를 높일 수 있다.
  • 범용 로더가 아니라 antirez의 ds4 추론 엔진 전용으로 만들어진 점이 다른 GGUF 양자화판과 다르다.

제한사항

  • ds4 엔진 전용으로 만들어져 다른 추론 엔진에서는 동작이 보장되지 않으며, 특히 MTP(추측 디코딩) 파일은 전용 로더가 필요해 범용 GGUF 로더와 호환되지 않는다.
  • 가장 작은 q2 파일도 80.8GiB, q4는 153.3GiB로 각각 128GB·256GB 이상의 시스템 메모리가 필요해 일반 소비자용 하드웨어에서는 구동이 어렵다.

427

LIKES

1.1M

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.