본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

zai-org/GLM-5.3

텍스트 생성 (코딩 및 에이전트 작업 특화)300K 컨텍스트other

GLM-5.2 대비 코딩 및 사이버 보안 능력을 강화하고 추론 비용 제어 기능을 추가한 고성능 코딩 에이전트 모델이다.

학습 방식 · GLM-5.2 기반의 모델로, 추가적인 포스트 트레이닝(Post-training)을 통해 코딩 및 장기 추론 능력을 강화했다.

TL;DR

GLM-5.3은 GLM-5.2를 기반으로 포스트 트레이닝을 거쳐 코딩 및 에이전트 작업 능력을 대폭 강화한 모델이다. 복잡한 코딩 문제 해결과 사이버 보안 취약점 탐지에서 SOTA급 성능을 보이며, reasoning_effort 파라미터를 통해 추론 비용을 유연하게 조절할 수 있다. Terminal Bench 3.0과 같은 에이전트 평가 환경에서 이전 버전 대비 괄목할 만한 성능 향상을 입증했다. 복잡한 장기 추론이나 자동화된 코딩 에이전트 구축이 필요한 환경에 적합하다.

핵심 포인트

  • GLM-5.2 대비 코딩 성능이 50% 향상되었으며 Terminal Bench 3.0 등 주요 벤치마크에서 오픈소스 SOTA를 달성했다.
  • 사이버 보안 취약점 탐지 및 익스플로잇 생성 능력이 강화되어 CyberGym 벤치마크에서 최고 성능을 기록했다.
  • 추론 비용을 제어하는 reasoning_effort 파라미터를 지원하여 복잡한 작업에 최적화된 연산 자원 할당이 가능하다.

제한사항

  • 공식 벤치마크 환경과 동일한 설정(Claude Code 2.1.207 등)을 갖추지 않으면 보고된 성능 재현이 어려울 수 있다.
  • 일부 벤치마크(ExploitGym 등)는 특정 타임아웃 및 토큰 제한 조건 하에 측정되어 실제 환경과 차이가 발생할 수 있다.

벤치마크

벤치마크지표비교
Terminal Bench 3.0score28.3vs GLM-5.2: 4.6
DeepSWEscore66.9vs GLM-5.2: 46.2
Agents' Last Examscore28.5vs GLM-5.2: 23.8
AutomationBenchscore48.2vs GLM-5.2: 26.2
HLE w/ Toolsscore62.5vs GLM-5.2: 54.7
GDPval-AA v2score1769vs GLM-5.2: 1508

이미지 분석

6개 벤치마크에서 GLM-5.3과 주요 경쟁 모델 간의 성능을 비교한 막대 그래프.
GLM-5.3(파란색)이 이전 버전인 GLM-5.2(녹색) 대비 Terminal Bench 3.0, DeepSWE 등 대부분의 지표에서 압도적인 성능 향상을 보임을 시각적으로 나타낸다. 특히 코딩 및 에이전트 작업 관련 벤치마크에서 경쟁 모델들과 대등하거나 우수한 성능을 달성했음을 보여준다.

1.1k

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.