1M 토큰 컨텍스트와 장기 에이전트 성능을 제공하는 GLM-5 시리즈
GLM-5 시리즈는 1M 토큰 컨텍스트, IndexShare와 MTP 같은 아키텍처 개선으로 장기 에이전트 작업과 코딩 성능을 끌어올린 대규모 공개 LLM이다.
TL;DR
GLM-5 시리즈는 장기 에이전트형 작업과 복잡한 시스템 엔지니어링을 목표로 개발된 대규모 공개 LLM 릴리스이다. GLM-5.2는 1M 토큰 컨텍스트를 안정적으로 유지하면서도 코드 관련 벤치마크에서 공개 모델 중 최상위권 성능을 보고했다. 아키텍처 측면에서 IndexShare로 네 개의 sparse attention 레이어마다 동일 인덱서를 재사용해 1M 컨텍스트에서 토큰당 FLOPs를 2.9× 줄였고, MTP 계층으로 speculative decoding의 수락 길이를 최대 20% 늘려 추론 효율을 개선했다. 모델 파일은 Hugging Face/ModelScope에 공개되어 vLLM·SGLang·Transformers 등 표준 런타임으로 배포 가능하며, reasoning_effort 파라미터로 사고 예산을 조절하거나 enable_thinking=false로 사고를 끌 수 있다. 트레이드오프는 매우 긴 컨텍스트와 높은 성능을 위해 큰 모델(744B)과 관련된 컴퓨팅·메모리 비용이 요구된다는 점이다. (GLM-5.2의 주요 수치: Terminal-Bench 2.1 = 81.0, SWE-bench Pro = 62.1; Vending Bench 최종 잔액 = $4,432. 위 수치는 README 본문 및 첨부 차트에 근거한다.)
주요 기능
- 1M 토큰 컨텍스트로 장기 세션을 유지
- reasoning_effort 파라미터로 사고(Thinking) 예산을 조절
- IndexShare·MTP 등 아키텍처로 토큰당 연산량과 추론 효율 최적화
- vLLM, SGLang, Transformers 등 표준 추론 프레임워크로 로컬 배포
- BF16/FP8 포맷으로 모델 파일 제공
어떻게 동작하는가
GLM-5 계열은 긴 컨텍스트를 지원하기 위해 IndexShare를 도입해 네 개의 sparse attention 레이어마다 동일한 인덱서를 재사용함으로써 1M 토큰에서 토큰당 FLOPs를 2.9× 줄인다. 또한 MTP 계층을 통해 speculative decoding의 수락 길이를 최대 20%까지 늘려 추론 효율을 개선하고, slime 비동기 RL 인프라로 후처리 학습 반복을 촘촘하게 실행한다.
해결 문제
장기(수백 라운드, 수천 개 툴 호출)에 걸친 에이전트형 워크플로와 복잡한 시스템 엔지니어링을 안정적으로 수행할 수 있는 모델 컴퓨팅·추론 효율 문제를 완화한다.
지금 주목받는 이유
GLM-5.2 출시와 기술보고서(arXiv) 공개로 장기 컨텍스트·에이전트 성능에 대한 관심이 집중되었기 때문
차별점
- 1M 토큰의 안정적 컨텍스트를 제공해 긴 작업·세션에서 성능 유지
- IndexShare로 1M 컨텍스트에서 토큰당 FLOPs를 2.9× 절감한 아키텍처 개선
- MTP 계층으로 speculative decoding 수락 길이를 최대 20% 증가시켜 실효 추론 길이 개선
- 공개 모델 중 코드·에이전트 벤치마크에서 최상위권 성능(예: Terminal-Bench 2.1: 81.0)을 보고
사용 사례
- 장기간 도구 호출과 반복 실험이 필요한 에이전트형 개발 자동화(예: 긴 리팩터링·CI 자동화)
- 터미널 기반 실세계 작업 자동화 및 리포지토리 생성(NL2Repo, Terminal-Bench)
- 시뮬레이션 기반 장기 의사결정·운영 시나리오 평가(예: Vending Bench 시뮬레이션)
- 대규모 코드 완성·디버깅 워크플로에서 다단계 추론과 반복 최적화
시작하기
모델 파일은 Hugging Face / ModelScope에 공개되어 있으며 vLLM, SGLang, Transformers, KTransformers 등의 런타임에서 배포 가능하다. 간단한 시작 흐름은 모델 다운로드 → 지원 프레임워크(vLLM 또는 SGLang)에서 로드 → 필요 시 reasoning_effort="high" 또는 enable_thinking=false로 사고 예산 조절이다.
요구사항
- 모델 크기: 744B-A40B (활성 40B)
- 모델 포맷: BF16 또는 FP8 (별도 릴리스)
- 권장 런타임 버전: SGLang >= v0.5.13.post1, vLLM >= v0.23.0, Transformers >= v0.5.12
- Ascend NPU 배포(옵션): vLLM-Ascend, xLLM, SGLang 등 지원
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | score | 81.0 | vs GLM-5.1: 62.0; vs Claude Opus 4.8: 85.0 |
| SWE-bench Pro | score | 62.1 | vs GLM-5.1: 58.4 |
| Vending Bench 2 | final_balance | $4,432 | vs Claude Opus 4.5: $4,967 |
이미지 분석




5.3k
Stars
585
Forks
+239
Trending
3
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.