1M 토큰 컨텍스트와 1비트 GGUF 배포
장기 컨텍스트 텍스트 생성과 코딩 보조, 툴 사용을 포함한 멀티태스크 텍스트 생성 작업을 목표로 한다. 모델은 대규모 문서 생성과 긴 대화 유지, 터미널 스타일 상호작용과 코드 작성 시나리오에서 사용되도록 설계되었다. 도구 연동 환경에서는 툴과 함께 동작하는 테스트셋 성능을 공식 벤치마크에 보고하였다.1K 컨텍스트mit
GLM-5.2 기반의 GGUF 양자화 배포로서 1M 토큰 컨텍스트를 안정적으로 지원하고 코드 생성과 장기 문맥 작업에서 성능을 끌어내도록 설계되었다.
TL;DR
GLM-5.2의 GGUF 배포본은 긴 문맥 처리와 실사용 배포 편의성에 초점을 맞춘 모델이다. 아키텍처 수준에서 IndexShare를 도입해 네 개 레이어 단위로 인덱서를 재사용함으로써 1M 토큰 길이에서 토큰당 FLOPs를 2.9배 줄였고 MTP 레이어의 개선으로 speculative decoding의 수용 길이를 최대 20퍼센트 늘렸다. README에 보고된 벤치마크는 Terminal Bench 81.0과 AIME 99.2 같은 항목에서 높은 성능을 보이며 코드 생성과 도구 연동 시나리오에서도 경쟁력을 나타낸다. Unsloth는 GGUF 포맷과 1비트 UD-IQ1_M 양자화 데모를 통해 로컬 저자원 환경에서의 배포·실행 가능성을 제시하고 있으며 라이선스는 MIT로 개방적 사용이 가능하다.
핵심 역량
- 긴 시퀀스 처리와 연속된 문맥 유지를 기반으로 문서 생성과 요약, 롱폼 창작 작업을 안정적으로 수행할 수 있다. 1M 토큰 길이 내에서 맥락을 유지하며 이전 토큰 정보를 참조해 일관된 출력을 생성한다. 이 능력은 긴 코드베이스나 장문 대화의 문맥 유지에 직접적으로 적용된다.
- 코드 생성 및 터미널 상호작용에서 활용될 수 있는 성능을 제공한다. README의 Terminal Bench 성적과 SWE-bench Pro 성적이 이를 뒷받침하며 다양한 난이도의 코딩 질의를 처리할 수 있다. 다중 thinking effort 토글을 통해 성능과 응답 지연 사이의 균형을 조절할 수 있다.
- 도구 연동 시나리오에서 툴을 활용한 응답 생성 능력을 갖추고 있다. HLE(w Tools)와 Tool-Decathlon 관련 성적 보고는 외부 툴과 결합한 작업에서의 적용 가능성을 시사한다. 툴 사용과 결합된 추론 흐름에서 안정적인 출력 수렴이 목표이다.
- 로컬 환경에서 GGUF 양자화 변형으로 실행 가능하여 저자원 환경에서도 모델을 배포할 수 있다. Unsloth가 제공하는 양자화 벤치마크와 1비트 UD-IQ1_M 데모는 경량화된 추론 실행 사례를 보여준다. 이는 클라이언트 측 추론과 오프라인 사용 사례에서 유용하게 적용될 수 있다.
강점
- 긴 컨텍스트 처리 역량이 가장 큰 강점이다. README에서 'solid 1M-token context'로 표기되어 있으며 긴 문서와 장기 의존성 작업에서 유리한 설계 목표를 갖는다. 이 점은 긴 대화 유지나 대형 코드베이스 작업에서 실용적 이점을 제공한다.
- IndexShare 도입으로 1M 토큰 길이에서 토큰당 FLOPs를 2.9배 감소시킨 수치가 명시되어 있다. 이 연산 절감은 대규모 컨텍스트에서 추론 비용과 메모리 부담을 낮추는 직접적인 이점으로 연결된다. 또한 MTP 레이어의 speculative decoding 개선으로 수용 길이를 최대 20퍼센트 늘린 점이 추가 강점으로 보고되었다.
훈련 방식
기반 모델은 zai-org/GLM-5.2이며 아키텍처 수준에서 IndexShare와 MTP 레이어 개선을 적용해 긴 컨텍스트 처리와 speculative decoding 효율을 높였다. README는 구체적 학습 데이터나 SFT/DPO 등의 세부 파인튜닝 절차는 명시하지 않았다. 따라서 훈련 측면에서는 기반 GLM-5.2의 아키텍처 개선 중심으로 기술적 접근이 이루어졌음이 확인된다.
알아두면 좋은 것
- 모델은 MIT 라이선스를 채택하여 지역적 제약 없이 자유롭게 사용 가능하다. 오픈 라이선스는 상업적 사용과 재배포에 제약을 낮추며 연구·개발자 커뮤니티의 접근성을 높인다. README에 라이선스 표기가 명확히 기재되어 있다.
- GLM-5.2는 'solid 1M-token context'을 주요 기능으로 내세우며 긴 문맥 유지 능력을 핵심 차별점으로 제시하고 있다. 이 컨텍스트 길이는 긴 문서, 연속 대화, 대형 코드 베이스 문제를 다루는 응용에 필요한 설계 목표로 표기되었다. 문서에 해당 수치와 함께 강조 문구가 포함되어 있다.
- IndexShare라는 아키텍처 변경으로 네 개의 sparse attention 레이어마다 동일한 인덱서를 재사용함으로써 토큰당 FLOPs를 2.9배 줄였다고 보고되었다. README는 관련 arXiv 논문을 참조하고 해당 감소율 수치를 명시하고 있다. 이러한 계산 절감은 1M 토큰 길이에서 실용적 이점을 제공한다.
- Unsloth 측에서 GGUF 포맷과 여러 양자화 설정의 실행 예시를 제공하며 1비트 UD-IQ1_M 데모 GIF를 포함했다. 해당 데모는 로컬 추론 UI에서의 토글과 양자화된 모델 실행을 시연하는 화면을 포함하고 있다. 문서와 링크는 Unsloth의 실행 가이드와 벤치마크로 연결된다.
기술적 특징
- IndexShare는 sparse attention 인덱서를 네 개 레이어 단위로 재사용하는 설계로서 토큰당 연산량을 줄이는 목적을 가진다. README에 따르면 이 설계는 1M 토큰 길이에서 토큰당 FLOPs를 2.9배 낮춘 것으로 나타났다. 연산 절감은 긴 컨텍스트를 실용적으로 다루기 위한 핵심 공정이다.
- MTP 레이어의 개선은 speculative decoding의 수용 가능한 길이를 증가시켜 추론 효율을 높였다. README는 이 개선으로 acceptance length가 최대 20퍼센트 증가했다고 명시하고 있다. 이 변화는 미리 생성한 후보 토큰을 보다 효과적으로 활용해 실제 디코딩 비용을 줄이는 쪽으로 작동한다.
- 코드 생성 측면에서는 다중 thinking effort 토글을 통해 성능과 지연 사이의 균형을 조정할 수 있도록 설계되었다. Unsloth Studio 예시는 High와 Max 같은 모드 전환을 통해 같은 모델에서 다른 응답 지연과 성능을 선택하는 인터페이스를 제공한다. 이 접근은 실사용자가 응답 속도 제한이나 품질 우선순위를 직접 조정할 수 있게 한다.
- 배포 측면에서는 GGUF 포맷을 통한 양자화 변형과 1비트 UD-IQ1_M 데모가 문서에 포함되어 있다. 이러한 양자화는 로컬 환경에서 모델을 실행할 때 메모리와 저장공간 요구를 낮추는 실용적 방법이다. README는 Unsloth의 양자화 벤치마크 문서를 참조하는 링크를 제공한다.
차별점
- 1M 토큰 길이를 'solid'하게 유지한다고 명시한 긴 컨텍스트 지원 능력은 동종 모델과 구별되는 핵심 요소이다. README에서 해당 수치와 함께 IndexShare라는 아키텍처 기법을 연결해 제시하고 있다. 이는 긴 문맥 작업을 우선적으로 고려한 설계임을 반영한다.
- IndexShare로 인한 토큰당 FLOPs 감소와 MTP 기반 speculative decoding 개선을 동시에 보고한 점이 특이점이다. 두 기술 요소가 결합되어 긴 컨텍스트에서의 계산 효율과 디코딩 효율을 동시에 겨냥한다. 이러한 설계 조합은 대형 문맥 환경에서 실용적 비용 절감을 노리는 차별화 전략이다.
- Unsloth가 제공하는 GGUF 양자화 배포와 1비트 양자화 데모를 README에 포함해 로컬 저자원 실행 사례를 명확히 제시한 점이 배포 차별화 요소다. 사용자는 다양한 양자화 설정을 시험해 성능과 리소스 요구를 조절할 수 있다. 이는 연구자와 엔지니어가 모델을 로컬에 적용하는 진입 장벽을 낮춘다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HLE | score | 40.5 | — |
| HLE (w/ Tools) | score | 54.7 | — |
| AIME 2026 | score | 99.2 | — |
| Terminal Bench 2.1 (Terminus-2) | score | 81.0 | — |
| SWE-bench Pro | score | 62.1 | — |
| NL2Repo | score | 48.9 | — |
| DeepSWE | score | 46.2 | — |
| ProgramBench | score | 63.7 | — |
| MCP-Atlas (Public Set) | score | 76.8 | — |
이미지 분석


508
Likes
307k
Downloads
7 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.