본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

zai-org/GLM-5.3-Flash

텍스트 생성과 대화, 이미지·텍스트 입력을 처리하며 코딩 및 에이전트 작업을 수행하는 멀티모달 언어 모델320B total parameters, 18B active parametersMIT

320B 모델에서 18B만 활성화해 멀티모달·코딩·에이전트 작업을 처리하는 GLM-5 계열 모델

학습 방식 · 새로 학습한 base model에 Sparse attention과 linear attention을 결합한 hybrid architecture, Manifold-Constrained Hyper-Connections와 30T-token 멀티모달 사전 학습을 적용했습니다.

TL;DR

GLM-5.3-Flash는 GLM-5 시리즈의 새 base model에서 출발한 네이티브 멀티모달 모델로, 320B 전체 파라미터 중 18B만 활성화하는 구조입니다. Sparse attention과 linear attention을 결합해 긴 컨텍스트의 serving 비용을 줄이고, Manifold-Constrained Hyper-Connections로 scaling 효율을 높였습니다. 30T-token 멀티모달 사전 학습을 거쳐 GLM-5.2보다 코딩·에이전트 벤치마크 전반에서 높은 점수를 기록했으며, 로컬 실행은 SGLang, vLLM, TokenSpeed, KTransformers를 지원합니다.

핵심 포인트

  • 320B 전체 파라미터 중 18B만 활성화해 대규모 모델의 추론 비용을 낮춥니다.
  • Sparse attention과 linear attention을 결합해 긴 컨텍스트 처리 비용을 줄입니다.
  • 30T 토큰 규모의 멀티모달 사전 학습으로 GLM-5 시리즈 최초의 네이티브 멀티모달 기능을 구현합니다.
  • Terminal Bench 2.1에서 84.3점, DeepSWE에서 63.4점으로 코딩·에이전트 성능을 측정했습니다.

제한사항

  • README는 로컬 배포 프레임워크를 제시하지만 권장 하드웨어 구성이나 실제 메모리 요구량은 밝히지 않습니다.
  • HLE w/ Tools와 Terminal-Bench 등 주요 점수는 특정 temperature, context length, judge model과 실행 harness를 사용한 평가 결과라서 설정이 달라지면 직접 비교가 어렵습니다.

벤치마크

벤치마크지표비교
Terminal Bench 2.1benchmark score84.3차트 기준 GLM-5.2 81.0, Claude Opus 4.8 85.0, GPT-5.6 Terra 87.4
DeepSWE v1.1benchmark score63.4차트 기준 GLM-5.2 46.2, Claude Opus 4.8 58.0, GPT-5.6 Terra 69.6
Agents' Last Exambenchmark score26.3차트 기준 GLM-5.2 20.4, DeepSeek-V4-Vision-Exp 27.3, GPT-5.6 Terra 28.0
AutomationBench v1.0.6benchmark score48.8차트 기준 GLM-5.2 26.2, DeepSeek-V4-Vision-Exp 38.8, Gemini 3.7 Flash 52.3
HLE w/ Toolsbenchmark score55.3차트 기준 GLM-5.2 54.7, DeepSeek-V4-Vision-Exp 55.1, Claude Opus 4.8 57.9
GDPval-AA v2benchmark score1773차트 기준 GLM-5.2 1504, DeepSeek-V4-Vision-Exp 1675, Claude Opus 4.8 1582, GPT-5.6 Terra 1571, Gemini 3.7 Flash 1527

이미지 분석

GLM-5.3-Flash와 GLM-5.2 및 여러 상위 모델의 6개 코딩·에이전트 벤치마크 점수를 비교한 막대그래프입니다.
차트는 GLM-5.3-Flash가 GLM-5.2보다 Terminal Bench 2.1, DeepSWE v1.1, Agents' Last Exam, AutomationBench v1.0.6, HLE w/ Tools, GDPval-AA v2에서 모두 높은 점수를 기록한 것으로 나타냅니다. GLM-5.3-Flash의 점수는 각각 84.3, 63.4, 26.3, 48.8, 55.3, 1773이며, 비교 모델 가운데 일부는 벤치마크별로 결과가 표시되지 않았습니다.

770

LIKES

0

DOWNLOADS

2 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.