본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/GLM-5.3-Flash-GGUF

코딩·에이전트 작업·자동화·도구 사용을 위한 텍스트 생성MIT

320B 규모에서 18B만 활성화하는 GLM-5.3-Flash의 GGUF 양자화 배포판

학습 방식 · zai-org/GLM-5.3-Flash를 기반으로 새롭게 학습한 모델을 Unsloth Dynamic 3.0 GGUF 양자화 형식으로 변환한 배포판이며, Sparse·linear hybrid attention, Manifold-Constrained Hyper-Connections, 30T-token multimodal pre-training을 사용합니다.

TL;DR

이 모델은 zai-org/GLM-5.3-Flash를 기반으로 Unsloth가 만든 GGUF 양자화 배포판이며, 320B 전체 파라미터 중 18B만 활성화하는 sparse 구조를 사용합니다. Sparse attention과 linear attention을 결합하고 Manifold-Constrained Hyper-Connections를 적용해 긴 컨텍스트 처리의 계산 부담을 낮추도록 설계했습니다. 30T-token multimodal pre-training을 거친 GLM-5.3-Flash는 코딩과 에이전트 작업에서 GLM-5.2보다 높은 점수를 기록했으며, 제공된 차트에서 Terminal Bench 2.1 84.3점과 GDPval-AA v2 1773점을 기록했습니다. 다만 저장소가 WIP 상태라 정확한 양자화 변형과 하드웨어 요구사항은 별도 실행 가이드 확인이 필요합니다.

핵심 포인트

  • 320B 전체 파라미터 중 18B만 활성화하는 구조로 추론 비용과 처리량을 함께 겨냥합니다.
  • Sparse attention과 linear attention을 결합해 긴 컨텍스트에서 모든 토큰의 계산 부담을 줄입니다.
  • Manifold-Constrained Hyper-Connections와 30T-token multimodal 사전 학습을 함께 사용합니다.
  • GGUF 양자화 배포판으로 제공되며 Unsloth Dynamic 3.0 방식의 정확도 개선을 내세웁니다.

제한사항

  • README가 WIP 상태라 세부 실행 절차와 배포 파일 구성 정보가 아직 충분하지 않습니다.
  • 정확한 양자화 수준별 품질 차이와 하드웨어 요구사항이 README에 명시되지 않았습니다.
  • 공개된 컨텍스트 길이는 없으며, 벤치마크별 평가 조건이 서로 다릅니다.

벤치마크

벤치마크지표비교
Terminal Bench 2.1score84.3GLM-5.2 81.0, Claude Opus 4.8 85.0, GPT-5.6 Terra 87.4
DeepSWE v1.1score63.4GLM-5.2 46.2, DeepSeek-V4-Vision-Exp 59.3, GPT-5.6 Terra 69.6
Agents' Last Examscore26.3GLM-5.2 20.4, DeepSeek-V4-Vision-Exp 27.3, Claude Opus 4.8 27.0
AutomationBench v1.0.6score48.8GLM-5.2 26.2, DeepSeek-V4-Vision-Exp 38.8, Claude Opus 4.8 41.0
HLE w/ Toolsscore55.3GLM-5.2 54.7, DeepSeek-V4-Vision-Exp 55.1, Claude Opus 4.8 57.9
GDPval-AA v2score1773GLM-5.2 1504, DeepSeek-V4-Vision-Exp 1675, Claude Opus 4.8 1582

이미지 분석

GLM-5.3-Flash와 GLM-5.2 및 여러 상용·오픈 모델의 6개 평가 점수를 비교한 막대그래프입니다.
그래프는 Terminal Bench 2.1에서 84.3점, DeepSWE v1.1에서 63.4점, AutomationBench에서 48.8점, HLE w/ Tools에서 55.3점을 기록한 GLM-5.3-Flash의 결과를 제시합니다. GDPval-AA v2에서는 1773점을 기록했으며, 각 벤치마크의 평가 조건과 점수 체계가 다르므로 수치를 단순 합산해 성능 순위를 판단하기는 어렵습니다.

113

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.