jlnsrk/GLM-5.2-colibri-int4
사전 변환된 colibrì 전용 int4 가중치로 GLM-5.2 744B MoE를 NVMe 스트리밍으로 소비자급 환경에서 실행할 수 있도록 구성된 패키지이다.
학습 방식 · 기본은 zai-org/GLM-5.2-FP8 체크포인트를 기반으로 하며 학습 자체가 아니라 FP8→F32→int4 변환 과정을 거쳐 엔진 전용 포맷으로 변환한 산출물이다. 변환 스크립트는 ebits=4, io-bits=8 설정을 사용하고 per-row 스케일을 별도 F32 파일로 유지하여 엔진의 수치 규칙과 맞추도록 설계되었다. 이 과정은 학습을 포함하지 않고 모델을 추론 가능한 형식으로 변환하는 전처리 파이프라인으로 작동한다.
TL;DR
이 패키지는 zai-org/GLM-5.2-FP8 기반의 744B MoE 모델을 colibrì 엔진이 바로 사용할 수 있는 int4 포맷으로 사전 변환하여 제공한다. 변환 방식은 FP8→F32→int4 순으로 진행되며 np.rint를 사용해 엔진의 lrintf 연산과 수치적 일치를 확보하므로 로컬 변환 없이도 토큰-동일성이 유지된다. per-row F32 스케일과 패킹된 int4 가중치, 그리고 MTP 헤드를 포함한 구성은 NVMe에서 전문가를 스트리밍하며 약 25GB 수준의 RAM으로 대형 MoE를 운영할 수 있게 하고 처리량 향상을 위해 speculative decoding을 활용한다. 시스템 요구는 로컬 NVMe와 Linux 환경, AVX2 지원을 전제로 하며 이로 인해 타 런타임과의 호환성 대신 colibrì 전용 통합 효율을 확보한다.
핵심 포인트
- 이 패키지는 오직 colibrì 엔진에서만 읽을 수 있는 전용 포맷으로 제공되며 GGUF/AWQ/GPTQ/MLX와 호환되지 않는다는 점이 차별화 요소이다. 전용 포맷은 엔진의 C 커널 수치 규칙과 비트-동일 변환 규격을 따르기 때문에 colibrì 런타임과 결합할 때 높은 수치 일관성을 보장한다. 반면 다른 범용 추론 런타임과의 직접적인 교차사용성은 제공하지 않는다.
- 디스크 기반 전문가 스트리밍을 전제로 하여 약 25GB 수준의 RAM으로 744B MoE 모델을 운영 가능하게 만든 설계가 핵심 차별점이다. 스트리밍은 NVMe에서 전문가 블록을 필요 시 로드하는 방식으로 메모리와 저장 공간 요구를 현실적인 범위로 낮춘다. 이러한 접근은 대형 MoE 모델의 소비자급 배포 가능성을 실질적으로 높인다.
- MTP 헤드가 기본 포함되어 lossless speculative decoding을 네이티브로 지원한다는 점에서 처리량 최적화가 모델 패키지 수준에서 반영되어 있다. MTP의 포함은 추론 파이프라인 설계에서 단순 양자화 제공을 넘어 추론 속도 측면의 보완을 제공한다. 이로 인해 단순한 가중치 변환 이상으로 엔진-레벨 성능 개선을 목표로 한 통합 제공이 이루어졌다.
- 사전 변환된 컨테이너는 사용자가 756GB FP8 체크포인트를 내려받아 직접 변환할 필요를 제거하여 다운로드와 변환에 소요되는 시간과 스토리지 부담을 줄인다. 이로 인해 NVMe 기반의 빠른 로컬 스토리지를 갖춘 환경에서는 바로 추론을 시작할 수 있다. 엔진 전용 수치 규칙과 비트-동일 변환을 제공하므로 로컬 변환 시 발생할 수 있는 미묘한 숫자 불일치 위험을 제거한다.
143
LIKES
4k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.