mateogrgic/GLM-5.2-colibri-int4-with-int8-mtp
명시적 태스크 표기는 없으나 GLM 계열 LLM의 일반적 사용 맥락에서 대화형 생성과 텍스트 생성 기반 추론을 목적으로 배포된 형태이다.mit
colibrì 엔진 전용으로 포장된 GLM-5.2 int4 컨테이너로 int8 MTP heads를 추가하여 speculative decoding 수용률과 추론 속도를 개선한 배포물이다.
TL;DR
GLM-5.2 colibrì int4 컨테이너는 zai-org/GLM-5.2-FP8 기반의 양자화 모델을 colibrì 전용 포맷으로 제공하며 int8 MTP heads를 추가해 speculative decoding의 제안 수용률을 높이고 전체 추론 속도를 개선하려는 배포물이다. 이 구현은 GGUF/AWQ/GPTQ 형식이 아니므로 colibrì 런타임을 반드시 설치해야 하며 README는 int8 MTP heads 도입이 속도 향상의 핵심 원인이라고 명시했다. 사용을 위해서는 Linux(또는 WSL2), gcc와 OpenMP, AVX2 지원, 최소 16 GB의 RAM과 약 400 GB의 여유 NVMe가 필요하므로 로컬 고성능 스토리지와 CPU 환경을 갖춘 시스템에서만 실무적 이점을 얻을 수 있다.
핵심 포인트
- colibrì 전용 포맷으로서 GGUF/AWQ/GPTQ와 다른 실행 체계만을 지원한다.
- int4 양자화된 모델 본체와 int8 정밀도의 MTP heads를 함께 제공해 speculative decoding 성능을 개선하는 하이브리드 정밀도 전략을 사용한다.
- 배포 크기가 대형(약 370 GB)이며 로컬 NVMe와 AVX2·OpenMP 기반 CPU 실행을 전제로 설계되어 클라우드 GPU 의존 없이 로컬 배포를 목표로 한다.
- int8 MTP heads를 추가해 speculative decoding에서 제안의 수용률을 개선함으로써 README상 전체 추론 속도에서 'major inference speedboost'가 발생했다고 명시되었다. 이 구조는 제안-검증 루틴의 효율을 높여 동일 하드웨어에서 처리량을 끌어올리는 목적을 가진다. 또한 MIT 라이선스가 설정되어 있어 재사용과 수정이 상대적으로 자유로운 배포 형태이다.
115
LIKES
9.7k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.