meta-models/Muse-Glimmer-30B
Muse Spark에서 증류한 29.6B 멀티모달 에이전트, 4-bit 양자화 및 DFlash 드래프터 포함
학습 방식 · Muse Glimmer는 Muse Spark로부터의 distillation을 핵심으로 하며 perception encoder는 고정(frozen)된 ViT-G/14를 포함한다. 훈련 파이프라인에는 안전성 관련 SFT와 안전성 보상을 포함한 RL 절차가 포함되어 있어 에이전트적 행동 경계, 권한 처리, 프롬프트 인젝션 저항성 같은 특성들을 모델 가중치에 반영하도록 구성되어 있다. 또한 문서화된 전용 데이터와 외부 공급자·메타 인력의 큐레이션을 통해 멀티모달·에이전트 시나리오에 맞춘 합성 데이터와 실제 사례를 혼합해 학습한 점이 핵심적이다.
TL;DR
Muse Glimmer는 Muse Spark에서 증류한 29.6B 규모의 Dense Causal Transformer에 ViT-G/14 기반의 고정된 perception encoder를 결합한 멀티모달 에이전트 모델로, 텍스트·이미지를 입력받아 텍스트로 응답하도록 설계되어 있다. 로컬 배포를 목표로 4-bit 수준의 양자화와 DFlash 기반 drafter를 함께 제공해 24GB~32GB 소비자급 하드웨어에서 긴 컨텍스트(131,072+)와 실시간 대화 수준의 생성 속도를 달성하도록 구성되어 있으며, RTX 5090 기준으로 speculative decoding과 결합 시 약 3.1배 속도 향상이 보고되었다. 에이전트적 도구 호출, 단계적 추론, 실패 복구성 등에서 동일 급 모델 대비 높은 성능을 보였으나 일부 언어·비디오 입력 처리·양자화 엣지 케이스에서는 제약이 있으므로 배포 시 추가 안전검증과 휴먼인루프가 권장된다.
핵심 포인트
- Muse Glimmer는 Muse Spark에서 증류된 30억(29.6B) 매개변수를 가진 Dense Causal Transformer에 약 1.8B 파라미터의 ViT-G/14 기반 perception encoder를 결합한 멀티모달 모델이다. 텍스트와 이미지를 교차 입력으로 받아 최대 131,072 토큰의 긴 컨텍스트를 처리하며, 비전 입력은 최대 4,096 비주얼 토큰으로 인코딩된다. 이 구조는 스크린샷·문서·차트 해석을 포함한 에이전트 워크플로에서 텍스트 추론과 이미지 이해를 한 모델로 연속 처리하도록 설계되었다.
- 로컬 배포를 염두에 두고 최적화되었고, 4-bit 수준의 양자화로 언어모델 파라미터를 약 20GB 미만으로 압축해 24GB 또는 32GB급 소비자 하드웨어에서 실용적으로 구동되도록 설계되었다. 양자화는 K-Quant 계열 설정으로 제공되며, 개발자가 제시한 평가 평균에서 품질 저하는 극히 작아(예: K-Quant-17GB에서 평균 1.0% 감소) 에이전트 작업 성능을 거의 보존한다. 또한 DFlash 기반의 소형 drafter를 통해 블록 단위(16토큰) 제안과 주 모델의 병렬 검증을 결합하여 생성 속도를 크게 향상시키도록 세팅되어 있다.
- 에이전트 역량을 중점적으로 훈련·평가했으며 도구 호출, 단계적 추론, 실패 복구, 연속 작업 완수 능력에 초점이 맞춰져 있다. 공개 벤치마크(MCP-Atlas, DeepSearch QA, SWE-Bench 등)에서 동일 급 모델 대비 높은 성공률을 보였고, 특히 장기 논리 전개와 툴 스키마 호출 정확도에서 강점을 갖고 있다. 멀티언어 데이터로 학습했으나 일부 언어에서는 성능 저하 가능성이 있으며 비디오 입력은 프레임 단위 처리만 지원하는 제약이 존재한다.
제한사항
- 모델은 에이전트 작업에 최적화되어 있으나 여전히 잘못된 답변, 편향적 응답 또는 부적절한 결과를 생성할 가능성이 있다. 특히 훈련에서 드물게 등장하는 새로운 문제나 도메인에서는 단계적 추론 오류가 발생할 수 있으며, 이런 경우 추가적인 검증·휴먼인루프 안전 장치가 권장된다. 또한 비디오 입력은 연속 시퀀스가 아닌 개별 프레임으로만 처리되기 때문에 영상 특유의 시간적 맥락을 요구하는 작업에는 적합하지 않다.
- 양자화 추론은 대부분의 에이전트 벤치마크에서 거의 무시할 수준의 성능 저하를 보이지만, 엣지 케이스에서는 품질 차이가 나타날 수 있다. README가 제시한 수치에 따르면 K-Quant-Dynamic은 평균 약 0.2% 성능 저하, K-Quant-17GB는 평균 약 1.0% 저하를 보고하고 있어 일반적 워크플로에서는 실용적이지만 미세한 품질 민감 작업에는 주의가 필요하다. 또한 모델이 포함한 언어들 전부에 대해 균일하게 평가가 이루어지지 않아 일부 저지원 언어에서 성능 저하가 발생할 수 있다.
- 모델이 Muse Spark보다 전반적으로 낮은 능력 범위로 분류되어 있기는 하나, 에이전트형 작업에서 외부 툴과의 결합 시 잠재적 위험이 존재하므로 단독 엔드포인트로의 배치는 권장되지 않는다. README는 화학·생물·사이버 등의 리스크 축에서 대체로 'Moderate or lower' 등급을 보고하지만 실서비스에 배포할 때는 케이스별 안전성 평가와 추가 가드레일이 필요하다고 명시하고 있다. 마지막으로 18세 미만 개인의 직접 다운로드·사용을 권장하지 않으며 운영자는 관련 법규 준수와 위험 완화책 마련이 필요하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MCP Atlas (Public) | Success Rate | 75.5 | Gemma4-31B: 54.2; Qwen3.6-27B: 62.5 |
| DeepSearch QA | Score | 74.6 | Gemma4-31B: 61.7; Qwen3.6-27B: 71.1 |
| SWE-Bench Pro | Score | 51.2 | Gemma4-31B: 36.9; Qwen3.6-27B: 50.2 |
| Charxiv Reasoning | Score | 78.8 | Gemma4-31B: 77.7; Qwen3.6-27B: 78.4 |
679
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.