unsloth/Muse-Glimmer-30B-GGUF
Muse Glimmer-30B를 Unsloth용 4-bit GGUF로 최적화해 멀티모달 에이전트와 로컬 추론을 목표로 한 패키지
학습 방식 · 모델은 Muse Spark에서 증류한 30B급 Dense Causal Transformer와 약 1.8B 파라미터의 ViT-G/14 perception encoder를 결합한 구조로 훈련되었습니다. 안전성 강화를 위해 Safety SFT와 안전 중심의 RL을 포함한 보강 학습이 적용되었고 프롬프트 인젝션 방어, 도구 사용 경계 같은 에이전트 특화 패턴을 학습 데이터와 보상 신호로 통합했습니다. 학습 데이터는 공개 멀티모달 소스와 서드파티·Meta 소스가 혼합되어 있으며 모델 가중치에 적절한 정보 흐름 원칙을 심어 로컬 에이전트 구동 시 개인정보 흐름 제어도 고려했다고 명시되어 있습니다.
TL;DR
이 모델은 Meta의 Muse Glimmer-30B를 기반으로 Unsloth가 GGUF 양자화(약 4-bit)와 추론 최적화(예: Unsloth Dynamic K-Quant 계열)를 적용한 배포판으로, 로컬에서 멀티모달 에이전트 작업을 실행하도록 설계되어 있습니다. 전용 ViT-G/14 perception encoder와 131,072+ 길이 컨텍스트를 결합해 스크린샷·문서 기반의 다중단계 계획과 신뢰성 있는 도구 호출을 지원하며 DFlash 기반 drafter로 생성 속도도 크게 향상됩니다. 24GB~32GB급 소비자 하드웨어에서 실용적으로 구동되도록 양자화-속도-정확도 균형을 맞췄고 공개 벤치에서 동급 대비 경쟁력 있는 성능을 보입니다.
핵심 포인트
- 로컬 배포 최적화와 양자화 전략이 중심이며 입력→처리→출력 흐름에서 메모리 사용을 줄이는 방식으로 동작합니다. README에 따르면 모델 가중치를 약 4-bit 수준으로 압축해 언어 모델 부분을 20GB 이하로 줄였고 KV 캐시와 비전 인코더, DFlash 기반의 drafter를 동시에 운영할 여유를 확보한다고 명시되어 있습니다. 이 접근은 24GB~32GB 환경에서 실용적 속도로 에이전트 상호작용을 가능하게 해 실제 기기에서 긴 대화와 도구 연동을 수행할 수 있게 합니다.
- 사전학습 기반 설계와 증류, 그리고 안전 보강이 결합된 훈련 파이프라인을 사용합니다. 문서에 따르면 Muse Glimmer는 Muse Spark에서 distilled 되었고 Safety SFT와 안전 목적의 RL을 포함한 train-time mitigations을 적용해 에이전트용 안전 정책, 도구 경계, 프롬프트 인젝션 저항성 등을 모델 가중치에 반영했다고 명시되어 있습니다. 이러한 학습 흐름은 도구 호출 실패 시 진단·재시도 같은 실패 복구와 스캔폴드 호환성 같은 에이전트 행태에 영향을 주는 설계 선택과 연결됩니다.
- 생성 속도는 DFlash 기반의 speculative decoding으로 가속화되며 입력→제안→검증의 병렬화로 성능 향상을 달성합니다. DFlash drafter는 한 번에 16토큰 블록을 제안하고 메인 모델이 병렬로 검증해 맞는 토큰을 채택하는 구조를 사용한다고 문서에 기술되어 있습니다. 벤치마크 측정에서는 RTX 5090에서 토큰당 처리속도가 3.1배 향상되는 등 실측 속도 개선 수치가 제시되어 있어 대화형 에이전트와 실시간 상호작용에서 체감 성능 이득이 기대됩니다.
- 광범위한 벤치마크에서 동급 크기 모델 대비 경쟁력 있는 성능을 보입니다. MCP Atlas, DeepSearch QA, Charxiv Reasoning, AIME 2026 등 여러 에이전트·멀티모달·추론 벤치에서 Muse Glimmer-30B가 상위권 점수를 기록한 수치들이 공개되어 있습니다. 이 결과들은 모델이 멀티스텝 계획과 도구 사용, 멀티모달 이해를 요구하는 실제 워크플로에서 실용적 성능을 낼 수 있음을 시사합니다.
제한사항
- 양자화된 추론에서 극한의 엣지 케이스에서는 소량의 품질 저하가 발생할 수 있습니다. README는 K-Quant-17GB 설정에서 평균 지표 기준으로 약 1.0%의 열화를 보고하고 있고 K-Quant-Dynamic은 0.2% 수준의 열화를 제시했습니다. 따라서 정확도가 절대적으로 중요한 단계에서는 전체 정밀도나 추가 검증 레이어를 도입하는 것이 필요합니다.
- 비디오 입력은 지원되지 않으며 프레임 단위 처리만 허용됩니다. 문서에 따르면 비디오는 개별 프레임으로 처리되므로 연속적 시계열 영상 분석이나 행동 인식 같은 용도에는 최적화되어 있지 않습니다. 멀티모달 기능은 스크린샷·도표·문서와의 결합에 초점이 맞춰져 있으므로 영상 특화 응용에서는 별도 전처리 또는 전용 모델이 요구됩니다.
- 다국어 커버리지는 훈련 데이터에 포함된 언어에 따라 편차가 존재할 수 있습니다. README는 100개 이상의 언어를 포함했다고 언급하지만 모든 언어에서 균일한 성능을 보장하지는 않으며 일부 언어에서 성능 저하가 발생할 수 있습니다. 배포 전 목표 언어에 대한 별도 검증과 튜닝이 권장됩니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MCP Atlas (Public) | 점수 | 75.5 | Gemma4-31B: 54.2, Qwen3.6-27B: 62.5 |
| DeepSearch QA | 점수 | 74.6 | Gemma4-31B: 61.7, Qwen3.6-27B: 71.1 |
| Charxiv Reasoning | 점수 | 78.8 | Gemma4-31B: 77.7, Qwen3.6-27B: 78.4 |
| AIME 2026 | 점수 | 94.7 | Gemma4-31B: 89.2, Qwen3.6-27B: 94.1 |
| SWE-Bench Verified | 점수 | 76.0 | Gemma4-31B: 66.6, Qwen3.6-27B: 77.2 |
| IFBench | 점수 | 77.0 | Gemma4-31B: 76.0, Qwen3.6-27B: 70.8 |
이미지 분석

197
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.