zai-org/GLM-5.3
텍스트 생성 (코딩 및 에이전트 작업 특화)300K 컨텍스트other
GLM-5.2 대비 코딩 및 사이버 보안 능력을 강화하고 추론 비용 제어 기능을 추가한 고성능 코딩 에이전트 모델이다.
학습 방식 · GLM-5.2 기반의 모델로, 추가적인 포스트 트레이닝(Post-training)을 통해 코딩 및 장기 추론 능력을 강화했다.
TL;DR
GLM-5.3은 GLM-5.2를 기반으로 포스트 트레이닝을 거쳐 코딩 및 에이전트 작업 능력을 대폭 강화한 모델이다. 복잡한 코딩 문제 해결과 사이버 보안 취약점 탐지에서 SOTA급 성능을 보이며, reasoning_effort 파라미터를 통해 추론 비용을 유연하게 조절할 수 있다. Terminal Bench 3.0과 같은 에이전트 평가 환경에서 이전 버전 대비 괄목할 만한 성능 향상을 입증했다. 복잡한 장기 추론이나 자동화된 코딩 에이전트 구축이 필요한 환경에 적합하다.
핵심 포인트
- GLM-5.2 대비 코딩 성능이 50% 향상되었으며 Terminal Bench 3.0 등 주요 벤치마크에서 오픈소스 SOTA를 달성했다.
- 사이버 보안 취약점 탐지 및 익스플로잇 생성 능력이 강화되어 CyberGym 벤치마크에서 최고 성능을 기록했다.
- 추론 비용을 제어하는 reasoning_effort 파라미터를 지원하여 복잡한 작업에 최적화된 연산 자원 할당이 가능하다.
제한사항
- 공식 벤치마크 환경과 동일한 설정(Claude Code 2.1.207 등)을 갖추지 않으면 보고된 성능 재현이 어려울 수 있다.
- 일부 벤치마크(ExploitGym 등)는 특정 타임아웃 및 토큰 제한 조건 하에 측정되어 실제 환경과 차이가 발생할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal Bench 3.0 | score | 28.3 | vs GLM-5.2: 4.6 |
| DeepSWE | score | 66.9 | vs GLM-5.2: 46.2 |
| Agents' Last Exam | score | 28.5 | vs GLM-5.2: 23.8 |
| AutomationBench | score | 48.2 | vs GLM-5.2: 26.2 |
| HLE w/ Tools | score | 62.5 | vs GLM-5.2: 54.7 |
| GDPval-AA v2 | score | 1769 | vs GLM-5.2: 1508 |
이미지 분석

1.1k
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.