unsloth/Inkling-Small-GGUF
Inkling-Small을 llama.cpp에서 구동하기 위한 다중 정밀도 GGUF 양자화 배포판276B-A12Bapache-2.0
276B급 멀티모달 에이전틱 모델 Inkling-Small을 로컬 llama.cpp로 서빙하는 GGUF 패키지
학습 방식 · 42층 디코더에 256개 전문가 중 6개와 공유 전문가 2개를 라우팅하는 MoE 백본으로, 이미지는 계층적 패치 인코더, 오디오는 discrete 토큰 인코더로 통합해 학습했다.
TL;DR
이 저장소는 Inkling-Small(276B 총 파라미터·12B 활성 네이티브 멀티모달 MoE)을 llama.cpp에서 구동하기 위한 Unsloth Dynamic 2.0 GGUF 배포판으로, 카드는 1비트 UD-IQ1_S 빌드가 Unsloth Studio에서 돌아가는 예시를 함께 싣고 있다. 42층 디코더에서 256개 전문가 중 6개와 공유 전문가 2개를 라우팅하는 구조와 이미지·오디오 입력 처리 능력은 원본과 같으며, Unsloth Studio에서는 Thinking 토글로 사고 모드를 켜고 끌 수 있다. 카드에 실린 SWEBench Verified 80.2% 등은 원본 Inkling-Small 기준 수치이고 GGUF 양자화판을 별도로 측정한 값은 공개돼 있지 않다.
핵심 포인트
- Inkling-Small(276B-A12B 멀티모달 에이전틱 모델)을 llama.cpp에서 구동하기 위한 Unsloth Dynamic 2.0 GGUF 배포판이다.
- 카드는 1비트 UD-IQ1_S 빌드를 Unsloth Studio에서 돌리는 예시를 함께 실어 초저비트 실행을 보여준다.
- 카드의 SWEBench Verified 80.2%는 원본 Inkling-Small 수치이며 GGUF 양자화판 측정치는 공개되지 않았다.
- Unsloth Studio에서 Thinking 토글을 지원해 사고 모드를 켜고 끌 수 있다.
제한사항
- 환각, 지시 불일치, 긴 멀티턴 대화에서의 성능 저하 등 파운데이션 모델 공통 한계를 갖는다.
- 훈련 데이터 컷오프 이후의 사건은 반영하지 못한다.
- 의료·법률 등 고위험 도메인에는 추가 검증 없이 배포하지 말 것을 권고한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWEBench Verified | pass@1 | 80.2% | Qwen3.5-397B-A17B 76.4%, Nemotron 3 Ultra 70.7% — 기반 모델 Inkling-Small의 공개 수치, GGUF 양자화 버전 측정치 아님 |
75
LIKES
39.1k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.