본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/GLM-5.3-GGUF

텍스트 생성 및 대화형 코딩·에이전트 작업glm-5.3

GLM-5.3 기반 quantized GGUF 모델로 코딩·에이전트 작업에 활용

학습 방식 · zai-org/GLM-5.3을 기반으로 quantization해 GGUF로 배포했으며, GLM-5.3 자체는 GLM-5.2와 같은 base model에 post-training을 적용했습니다.

TL;DR

unsloth/GLM-5.3-GGUF는 zai-org/GLM-5.3을 기반으로 만든 quantized GGUF 배포본으로, 로컬 추론 환경에서 GLM-5.3을 실행할 때 사용합니다. GLM-5.3은 GLM-5.2와 같은 base model에 post-training을 적용했으며, README는 복잡한 코딩과 장기 작업 성능 향상을 설명합니다. `reasoning_effort`에 `low`, `high`, `max`를 지정해 사고 예산을 조절하고, 기본값은 `max`입니다. README 기준 Terminal Bench 3.0 28.3, CyberGym 84.5, AutomationBench 48.2, GDPval-AA v2 1769를 기록했습니다.

핵심 포인트

  • zai-org/GLM-5.3을 기반으로 한 quantized GGUF 배포본이라 GGUF 지원 실행 환경에 연결할 수 있습니다.
  • GLM-5.3은 GLM-5.2와 같은 base model에 post-training을 적용해 복잡한 코딩과 장기 작업을 강화했습니다.
  • `reasoning_effort`를 `low`, `high`, `max`로 지정해 작업별 사고 예산을 조절하며 기본값은 `max`입니다.
  • Terminal Bench 3.0 28.3, CyberGym 84.5, AutomationBench 48.2로 코딩·보안·자동화 성능을 측정했습니다.

제한사항

  • chat template의 `clear_thinking` 기본값이 `false`라 대화 시 명시적으로 `true`를 지정해야 합니다.
  • `reasoning_effort`에 `low` 또는 `high`를 사용하려면 값을 명시해야 하며, 생략하거나 다른 값을 넣으면 `max`로 처리됩니다.

벤치마크

벤치마크지표비교
Terminal Bench 3.0score28.3GLM-5.2 4.6, Kimi K3 17.4, Fable 5 33.7, GPT-5.6 Sol 34.6
DeepSWE (v1.1)score66.9GLM-5.2 46.2, Kimi K3 67.5, Fable 5 69.7, GPT-5.6 Sol 72.7
CyberGymscore84.5GLM-5.2 77.2, Kimi K3 80.0, Fable 5 83.8, GPT-5.6 Sol 83.6
AutomationBench (v1.0.6)score48.2GLM-5.2 26.2, Kimi K3 46.7, Fable 5 46.2, GPT-5.6 Sol 45.8
Agents' Last Exam (ALE-CLI)score28.5GLM-5.2 23.8, Kimi K3 27.6, Fable 5 23.8, GPT-5.6 Sol 28.6
HLE w/ Toolsscore62.5GLM-5.2 54.7, Kimi K3 59.8, Fable 5 63.9, GPT-5.6 Sol 64.5
GDPval-AA v2score1769GLM-5.2 1508, Kimi K3 1682, Fable 5 1743, GPT-5.6 Sol 1730
Terminal Bench 2.1score88.2GLM-5.2 81.0, Kimi K3 88.3, Fable 5 88.0, GPT-5.6 Sol 88.8
NL2Reposcore58.0GLM-5.2 48.9, Kimi K3 58.0, DeepSeek-V4 Pro-0813 61.1, Opus 4.8 69.7
ProgramBench (Almost Solved)score19.0GLM-5.2 9.5, Kimi K3 17.5, Qwen3.8-Max 10.5, Fable 5 33.0
FrontierSWEscore78.1GLM-5.2 67.5, Opus 4.8 66.5, Fable 5 88.2
SWE-Marathon (v1.1)score42.5GLM-5.2 19.4, Kimi K3 48.1, Opus 4.8 48.8, Fable 5 33.1
PostTrainBenchscore39.8GLM-5.2 31.7, Kimi K3 32.0, Opus 4.8 32.9, Fable 5 41.8
ExploitGym (2h / 6h)score105 / 130GLM-5.2 29 / 39, Kimi K3 36 / 70, Fable 5 181 / 247, GPT-5.6 Sol 216 / 293
ExploitBenchscore54.4GLM-5.2 24.4, Kimi K3 32.2, Opus 4.8 40.0, Fable 5 78.0
Toolathlon Verifiedpass@173.0GLM-5.2 59.9, Kimi K3 76.5, Fable 5 74.7, GPT-5.6 Sol 74.9

이미지 분석

GLM-5.3과 GLM-5.2, Kimi K3, Fable 5, GPT-5.6 Sol의 6개 벤치마크 점수를 비교한 막대그래프입니다.
그래프는 Terminal Bench 3.0에서 GLM-5.3 28.3과 GLM-5.2 4.6, DeepSWE에서 66.9와 46.2, Agents' Last Exam에서 28.5와 23.8을 비교합니다. AutomationBench 48.2, HLE w/ Tools 62.5, GDPval-AA v2 1769도 함께 표시해 코딩·자동화·도구 사용·업무 평가 영역의 수치를 한 화면에서 비교하게 합니다.

68

LIKES

74.5k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.