meta-models/Muse-Glimmer-30B-GGUF
Muse Glimmer 30B의 GGUF 4-bit 퀀타이즈드 릴리스로 이미지 입력은 별도 인코더와 drafter 조합 필요
학습 방식 · Muse Glimmer는 Muse Spark에서 증류된 30B급 causal Transformer를 기반으로 하며, 전용 perception encoder(ViT-G/14)를 고정(frozen) 상태로 결합해 멀티모달 입력을 처리합니다. 에이전트 역량 강화를 위해 Safety SFT와 안전 보상 신호를 포함한 Reinforcement Learning 단계를 병행했고, 도구 호출·실패 복구·장기 계획 같은 에이전트 행위를 모델 가중치에 내장하려는 목표로 훈련 데이터와 합성 스캔리오가 사용되었습니다. 최종 배포판은 4-bit 수준의 K-quant 양자화와 DFlash 기반 drafter를 함께 제공하여 로컬 추론에서 메모리·속도·품질 간 절충을 실무적으로 맞춘 형태입니다.
TL;DR
이 항목은 meta-models/Muse-Glimmer-30B의 K-quant GGUF 퀀타이즈드 릴리스로, 텍스트 전용 메인 체크포인트 두 가지와 이미지 입력을 위한 mmproj-kquant.gguf perception encoder 및 DFlash 기반 dflash-kquant.gguf drafter를 함께 사용해야 멀티모달 image→text 추론이 가능합니다. 4-bit 수준의 양자화를 통해 메인 모델을 약 20GB 이하로 압축해 24GB·32GB급 소비자 하드웨어에서 KV 캐시와 인코더·드래프터를 동시에 운용할 수 있으며, 벤치마크 평균 손실은 0.2%~1.0% 수준으로 보고되어 실사용 트레이드오프가 작습니다. Drafter와 speculative decoding을 병행하면 RTX 5090 기준 약 3.1배, Apple M4/M5 계열에서 1.5–1.8배의 토큰 생성 속도 향상을 확인했고, 에이전트적 도구 호출·장기 추론·실패 복구 능력에 초점을 맞춘 훈련과 안전 보완 절차가 포함되어 있습니다.
핵심 포인트
- 이 저장소는 meta-models/Muse-Glimmer-30B의 4-bit 수준 K-quant GGUF 빌드를 배포하며, 텍스트 전용 메인 체크포인트 두 가지(muse-glimmer-30B-kquant-dynamic.gguf, muse-glimmer-30B-kquant-17gb.gguf)를 제공합니다. 이미지 처리를 위해 별도의 mmproj-kquant.gguf perception encoder가 필요하고, 생성 속도를 높이기 위한 dflash-kquant.gguf drafter가 동봉되어 있어 세 파일을 조합해야 완전한 이미지→텍스트 흐름을 운영할 수 있습니다. 이러한 분리형 아티팩트 설계는 llama.cpp 같은 경량 런타임에서 로컬 추론을 가능하게 하며, 메인 모델의 메모리 발자국을 줄여 KV 캐시와 동시 운용을 허용합니다.
- DFlash 기반의 drafter는 블록 단위(16 토큰) 예측을 제안하고 메인 모델이 병렬로 검증해 잘 맞는 토큰을 받아들이는 speculative decoding 패턴을 사용합니다. 이 방식은 검증-교정 루프를 통해 출력 품질을 유지하면서 토큰/회수당 연산을 줄이는 구조이며, README에서 제시한 실측치는 RTX 5090에서 약 3.1배, Apple M4/M5 계열에서 1.5–1.8배의 평균 속도 향상을 보입니다. drafter는 퀀타이즈드 형태로 제공되어 메모리 오버헤드를 낮추면서도 실시간 대화형 에이전트 응답 속도를 개선합니다.
- 메인 언어모델은 약 29.6B 파라미터의 Dense Causal Transformer와 약 1.8B 파라미터 ViT-G/14 perception encoder를 결합한 구조이고, 광범위한 에이전트 벤치마크에서 동급 대비 높은 성능을 기록합니다. 공개된 벤치마크 표에서 MCP Atlas 75.5, DeepSearch QA 74.6, AIME 94.7 등 여러 항목에서 Gemma4-31B 및 Qwen3.6-27B와 비교해 우수하거나 근접한 성적을 보이며, 정밀 검증에서 K-quant 변형이 평균 0.2%~1.0% 수준의 품질 저하만 발생하는 것으로 보고되어 있습니다. 로컬 우선 설계와 안전 관련 SFT·RL 학습이 결합되어 에이전트 문맥에서 안정적인 도구 호출과 실패 복구 행동을 지원하도록 구성되어 있습니다.
제한사항
- 퀀타이즈드 빌드는 평균적으로 미미한 품질 저하를 보인다고 보고되며, README에 따르면 K-Quant-Dynamic은 평균 0.2% 수준, K-Quant-17GB는 평균 1.0% 수준의 벤치마크 성능 감소를 보입니다. 엣지 케이스나 희소한 언어·도메인에서는 이 미세 손실이 눈에 띄게 나타날 수 있으므로 배포 전 도메인별 검증이 필요합니다. 또한 본 릴리스의 텍스트 전용 메인 파일만으로는 이미지 입력 처리가 불가능하므로 mmproj-kquant.gguf를 반드시 함께 사용해야 합니다.
- 모델은 비디오 입력을 프레임 단위로 처리하도록 설계되어 있어 연속적 비디오 신호의 시간적 맥락을 네이티브로 다루지 못합니다. 따라서 비디오 기반 작업에서는 프레임 샘플링·전처리·시퀀싱 전략을 별도로 도입해야 하며, 그 과정에서 성능과 지연에 영향을 받을 가능성이 있습니다. README에서 언어별 성능이 일관적이지 않을 수 있다고 밝힌 만큼, 비주류 언어용 응용에서는 추가적인 평가와 튜닝이 권장됩니다.
- 안전성과 관련해 SFT·RL 기반 완화책이 적용되었지만, 모델은 여전히 부정확하거나 편향된 출력을 생성할 수 있고 특정 에이전트 시나리오에서는 위험 노출이 남아 있습니다. 배포 시에는 모델을 단독 엔드포인트로 두지 말고 입력·출력 필터링, 인간 검토, 권한 확인 등 추가적인 거버넌스 계층을 포함해야 합니다. README는 모델을 18세 미만 사용자가 직접 다운로드·사용하지 않도록 권고하며, 관련 법규와 정책 준수를 각 배포자가 책임져야 한다고 명시합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MCP Atlas (Public) | accuracy | 75.5 | vs Gemma4-31B: 75.5 vs 54.2; vs Qwen3.6-27B: 75.5 vs 62.5 |
| DeepSearch QA | accuracy | 74.6 | vs Gemma4-31B: 74.6 vs 61.7; vs Qwen3.6-27B: 74.6 vs 71.1 |
| AIME 2026 | score | 94.7 | vs Gemma4-31B: 94.7 vs 89.2; vs Qwen3.6-27B: 94.7 vs 94.1 |
| SWE-Bench Pro | accuracy | 51.2 | vs Gemma4-31B: 51.2 vs 36.9; vs Qwen3.6-27B: 51.2 vs 50.2 |
| Charxiv Reasoning | accuracy | 78.8 | vs Gemma4-31B: 78.8 vs 77.7; vs Qwen3.6-27B: 78.8 vs 78.4 |
| IFBench | score | 77.0 | vs Gemma4-31B: 77.0 vs 76.0; vs Qwen3.6-27B: 77.0 vs 70.8 |
139
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.