1M 토큰 컨텍스트·FP8로 긴 문맥 생성과 코딩 성능 강화
1M-token 컨텍스트를 안정적으로 유지하면서 IndexShare·MTP·FP8으로 토큰당 연산과 비용을 낮춘 GLM-5.2 계열의 LLM이다.
TL;DR
GLM-5.2-FP8는 긴 호라이즌 작업을 목표로 한 GLM-5 계열의 공개 모델로, 'solid 1M-token context'를 안정적으로 유지하도록 설계되어 긴 문맥 기반 생성과 연속적 작업에 초점을 맞췄다. 모델은 IndexShare와 MTP 레이어 개선을 핵심 아키텍처 변경점으로 제시하며, IndexShare는 네 개의 sparse attention 레이어마다 동일 인덱서를 재사용해 1M 토큰에서 토큰당 FLOPs를 약 2.9× 낮추고, MTP 레이어는 speculative decoding의 수용 길이를 최대 20% 늘렸다. 이와 함께 GLM-5.2-FP8는 FP8(safetensors) 형식으로 제공되어 메모리·I/O 효율을 높였고, 코딩 작업에서는 여러 'thinking effort' 모드로 성능과 응답 지연을 조절할 수 있다. 벤치마크에서 Terminal-Bench 81.0, MCP-Atlas 76.8, ProgramBench 63.7 등 코드·툴·에이전트 과제에서 경쟁력 있는 점수를 보였고, HLE 같은 고난도 리즌닝 과제는 도구 사용 시 향상된 성능(54.7)을 기록했다. 결과적으로 GLM-5.2-FP8는 긴 컨텍스트 처리와 추론 효율을 동시에 목표로 설계되어 대규모 컨텍스트 기반 애플리케이션에 적합하다. 다만 학습·파인튜닝 세부 설정과 파라미터 수치는 README에 명시되지 않아 내부 구성·학습 데이터 관련 구체적 정보는 별도 기술문서나 논문을 참조해야 한다.
핵심 역량
- 1M 토큰 규모의 장기 문맥을 이용한 긴 텍스트 생성 및 연속적 작업 유지
- 코드 생성 및 코드 관련 추론에서 여러 '생각 노력(levels of effort)' 설정으로 성능·지연 균형 조정
- 외부 툴 사용과 에이전트형 작업(툴 연동)을 통한 복합적 작업 흐름 처리
- 터미널 자동화 및 명령 실행 시나리오에 맞춘 텍스트-행동 산출
- vLLM·SGLang·Transformers 등 표준 추론 프레임워크로 로컬 배포 가능
강점
- 긴 컨텍스트 지원: 1M 토큰 컨텍스트를 안정적으로 유지한다고 명시되어 긴 호라이즌 작업에 직접 활용 가능하다.
- 코딩·터미널 성능 경쟁력: Terminal-Bench 2.1에서 81.0, ProgramBench에서 63.7, MCP-Atlas에서 76.8을 기록해 코드·터미널·에이전트 과제에서 우수한 성능을 보였다.
- 오픈 라이선스·배포 형식: MIT 라이선스와 FP8/safetensors 배포로 상업적 사용 및 경량화 배포가 용이하다.
알아두면 좋은 것
- 1M 토큰 컨텍스트를 안정적으로 유지하도록 설계되었으며 벤치마크 평가는 최대 수십만 토큰(max_new_tokens 32k~163,840 등) 환경에서 수행되었다.
- IndexShare를 도입해 1M 컨텍스트에서 토큰당 FLOPs를 약 2.9× 감소시키고, MTP 레이어 개선으로 speculative decoding 수용 길이를 최대 20% 향상시켰다.
- 모델은 MIT 라이선스로 공개되어 상업적·지역 제한 없이 사용 가능하며 safetensors·FP8 형식으로 배포된다.
- 로컬 배포를 위해 SGLang, vLLM, Transformers, KTransformers, Unsloth 등 여러 추론 엔진과 Ascend NPU 플랫폼을 공식 지원한다.
기술적 특징
- 1M 토큰 컨텍스트 지원: 모델 아키텍처와 컨텍스트 관리로 'solid 1M-token context'를 달성했다고 명시되어 긴 문맥 작업에서 상태 보존·참조가 가능하다. 평가 설정에서 최대 수십만 토큰의 생성 실험을 수행해 안정성을 검증했다.
- IndexShare 구조로 토큰당 연산 절감: IndexShare는 네 개의 sparse attention 레이어마다 동일한 인덱서를 재사용해 1M 토큰 길이에서 토큰당 FLOPs를 약 2.9× 낮춘다. 이는 긴 컨텍스트에서 계산·메모리 비용을 줄이는 설계 선택이다.
- MTP 레이어 기반 speculative decoding 개선: MTP 레이어가 speculative decoding 허용 길이를 최대 20% 늘려서 추론 효율과 출력 수용률을 동시에 개선했다. 이로 인해 높은 품질을 유지하면서도 응답 지연을 줄일 수 있다.
- FP8 배포 포맷으로 효율화: 모델이 FP8(safetensors) 형식으로 제공되어 메모리 사용량과 I/O 비용을 낮추고 로컬·엔드포인트 배포에서 연산 효율을 높이도록 설계되었다.
- 코딩에 맞춘 다중 'thinking effort' 모드: 코딩 작업에서 성능과 지연을 균형시키는 여러 사고 노력 레벨을 제공해, 높은 신뢰도의 답변과 빠른 응답 사이의 트레이드오프를 운영 단계에서 조절할 수 있다.
차별점
- IndexShare로 sparse attention 인덱서를 여러 레이어에서 재사용해 1M 컨텍스트에서 토큰당 FLOPs를 크게 절감한 구조
- MTP 레이어 개선을 통한 speculative decoding 수용 길이 증가(최대 20%)로 생성 효율을 높임
- FP8(safetensors) 배포로 대규모 컨텍스트에서의 메모리·전송 효율을 고려한 배포 형식
- MIT 라이선스로 완전 개방되어 상업적·지리적 제한 없이 사용 가능
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HLE | score | 40.5 | — |
| HLE (w/ Tools) | score | 54.7 | — |
| SWE-bench Pro | score | 62.1 | — |
| Terminal-Bench 2.1 (Terminus-2) | score | 81.0 | — |
| NL2Repo | score | 48.9 | — |
| DeepSWE | score | 46.2 | — |
| ProgramBench | score | 63.7 | — |
| MCP-Atlas (Public Set) | score | 76.8 | — |
| Tool-Decathlon | score | 48.2 | — |
이미지 분석

176
Likes
772.7k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.