zai-org/GLM-5
GLM-5 시리즈는 1M 토큰 컨텍스트, IndexShare와 MTP 같은 아키텍처 개선으로 장기 에이전트 작업과 코딩 성능을 끌어올린 대규모 공개 LLM이다.
TL;DR
GLM-5 시리즈는 장기 에이전트형 작업과 복잡한 시스템 엔지니어링을 목표로 개발된 대규모 공개 LLM 릴리스이다. GLM-5.2는 1M 토큰 컨텍스트를 안정적으로 유지하면서도 코드 관련 벤치마크에서 공개 모델 중 최상위권 성능을 보고했다. 아키텍처 측면에서 IndexShare로 네 개의 sparse attention 레이어마다 동일 인덱서를 재사용해 1M 컨텍스트에서 토큰당 FLOPs를 2.9× 줄였고, MTP 계층으로 speculative decoding의 수락 길이를 최대 20% 늘려 추론 효율을 개선했다. 모델 파일은 Hugging Face/ModelScope에 공개되어 vLLM·SGLang·Transformers 등 표준 런타임으로 배포 가능하며, reasoning_effort 파라미터로 사고 예산을 조절하거나 enable_thinking=false로 사고를 끌 수 있다. 트레이드오프는 매우 긴 컨텍스트와 높은 성능을 위해 큰 모델(744B)과 관련된 컴퓨팅·메모리 비용이 요구된다는 점이다. (GLM-5.2의 주요 수치: Terminal-Bench 2.1 = 81.0, SWE-bench Pro = 62.1; Vending Bench 최종 잔액 = $4,432. 위 수치는 README 본문 및 첨부 차트에 근거한다.)
핵심 포인트
- 1M 토큰의 안정적 컨텍스트를 제공해 긴 작업·세션에서 성능 유지
- IndexShare로 1M 컨텍스트에서 토큰당 FLOPs를 2.9× 절감한 아키텍처 개선
- MTP 계층으로 speculative decoding 수락 길이를 최대 20% 증가시켜 실효 추론 길이 개선
- 공개 모델 중 코드·에이전트 벤치마크에서 최상위권 성능(예: Terminal-Bench 2.1: 81.0)을 보고
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | score | 81.0 | vs GLM-5.1: 62.0; vs Claude Opus 4.8: 85.0 |
| SWE-bench Pro | score | 62.1 | vs GLM-5.1: 58.4 |
| Vending Bench 2 | final_balance | $4,432 | vs Claude Opus 4.5: $4,967 |
이미지 분석




5.3k
STARS
585
FORKS
+239
TRENDING
3
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.