unsloth/GLM-5.3-Flash-GGUF
320B 규모에서 18B만 활성화하는 GLM-5.3-Flash의 GGUF 양자화 배포판
학습 방식 · zai-org/GLM-5.3-Flash를 기반으로 새롭게 학습한 모델을 Unsloth Dynamic 3.0 GGUF 양자화 형식으로 변환한 배포판이며, Sparse·linear hybrid attention, Manifold-Constrained Hyper-Connections, 30T-token multimodal pre-training을 사용합니다.
TL;DR
이 모델은 zai-org/GLM-5.3-Flash를 기반으로 Unsloth가 만든 GGUF 양자화 배포판이며, 320B 전체 파라미터 중 18B만 활성화하는 sparse 구조를 사용합니다. Sparse attention과 linear attention을 결합하고 Manifold-Constrained Hyper-Connections를 적용해 긴 컨텍스트 처리의 계산 부담을 낮추도록 설계했습니다. 30T-token multimodal pre-training을 거친 GLM-5.3-Flash는 코딩과 에이전트 작업에서 GLM-5.2보다 높은 점수를 기록했으며, 제공된 차트에서 Terminal Bench 2.1 84.3점과 GDPval-AA v2 1773점을 기록했습니다. 다만 저장소가 WIP 상태라 정확한 양자화 변형과 하드웨어 요구사항은 별도 실행 가이드 확인이 필요합니다.
핵심 포인트
- 320B 전체 파라미터 중 18B만 활성화하는 구조로 추론 비용과 처리량을 함께 겨냥합니다.
- Sparse attention과 linear attention을 결합해 긴 컨텍스트에서 모든 토큰의 계산 부담을 줄입니다.
- Manifold-Constrained Hyper-Connections와 30T-token multimodal 사전 학습을 함께 사용합니다.
- GGUF 양자화 배포판으로 제공되며 Unsloth Dynamic 3.0 방식의 정확도 개선을 내세웁니다.
제한사항
- README가 WIP 상태라 세부 실행 절차와 배포 파일 구성 정보가 아직 충분하지 않습니다.
- 정확한 양자화 수준별 품질 차이와 하드웨어 요구사항이 README에 명시되지 않았습니다.
- 공개된 컨텍스트 길이는 없으며, 벤치마크별 평가 조건이 서로 다릅니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal Bench 2.1 | score | 84.3 | GLM-5.2 81.0, Claude Opus 4.8 85.0, GPT-5.6 Terra 87.4 |
| DeepSWE v1.1 | score | 63.4 | GLM-5.2 46.2, DeepSeek-V4-Vision-Exp 59.3, GPT-5.6 Terra 69.6 |
| Agents' Last Exam | score | 26.3 | GLM-5.2 20.4, DeepSeek-V4-Vision-Exp 27.3, Claude Opus 4.8 27.0 |
| AutomationBench v1.0.6 | score | 48.8 | GLM-5.2 26.2, DeepSeek-V4-Vision-Exp 38.8, Claude Opus 4.8 41.0 |
| HLE w/ Tools | score | 55.3 | GLM-5.2 54.7, DeepSeek-V4-Vision-Exp 55.1, Claude Opus 4.8 57.9 |
| GDPval-AA v2 | score | 1773 | GLM-5.2 1504, DeepSeek-V4-Vision-Exp 1675, Claude Opus 4.8 1582 |
이미지 분석

113
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.