본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/Kimi-K3-GGUF

Kimi K3를 llama.cpp에서 구동하기 위한 다중 정밀도 GGUF 양자화 배포판2.8T-A104B1K 컨텍스트other

2.8T급 Kimi K3를 로컬 llama.cpp로 서빙하는 비전 지원 GGUF 패키지

학습 방식 · Kimi Delta Attention(KDA)과 Attention Residuals(AttnRes) 기반 Stable LatentMoE로 896개 전문가 중 16개를 라우팅하며, 처음부터 MXFP4 가중치·MXFP8 활성값의 양자화 인지 학습(QAT)으로 훈련했다.

TL;DR

이 저장소는 Kimi K3(2.8T 총 파라미터·104B 활성 네이티브 멀티모달 MoE)를 llama.cpp에서 구동하기 위한 Unsloth Dynamic 2.0 GGUF 배포판으로, 전용 llama.cpp 포크가 필요하며 Q4(UD-Q4_K_XL)부터 Q8(UD-Q8_K_XL, Q4보다 50GB 더 큼)까지 정밀도를 고를 수 있다. 원본의 비전 입력 처리 능력을 그대로 지원해 GGUF로도 이미지 이해가 가능하고, Unsloth Studio에서 High/Max 두 단계의 사고 강도 토글을 켤 수 있다. 100만 토큰 컨텍스트와 KDA+Gated MLA 하이브리드 어텐션 구조는 원본과 같으며, 카드에 실린 벤치마크는 원본 수치이고 양자화판을 따로 측정한 값은 아니다. 대형 MoE를 자체 GPU 클러스터 없이 로컬로 돌려보려는 사용자에게 적합하다.

핵심 포인트

  • Kimi K3(2.8T-A104B)를 llama.cpp에서 돌리기 위한 Unsloth Dynamic 2.0 GGUF 배포판이다.
  • Q4(UD-Q4_K_XL)부터 Q8(UD-Q8_K_XL, Q4보다 50GB 더 큼)까지 다양한 정밀도를 제공한다.
  • 비전 입력을 지원한다고 카드가 명시해 GGUF로도 이미지를 함께 넣어 쓸 수 있다.
  • Unsloth Studio에서 High/Max 두 단계의 사고 강도 토글을 지원한다.

벤치마크

벤치마크지표비교
GPQA Diamondaccuracy93.5Claude Opus 4.8 91.0, GPT-5.6 Sol 94.1 — 기반 모델 Kimi K3의 공개 수치, GGUF 양자화 버전 측정치 아님
AA-LCRaccuracy74.7GLM-5.2 71.3 — 기반 모델 Kimi K3의 공개 수치, GGUF 양자화 버전 측정치 아님

335

LIKES

274.5k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.