AngelSlim/Hy4-preview-GGUF
대화형 언어 생성
Hy4-preview를 전용 patch와 혼합 정밀도 quantization으로 약 214GiB까지 줄인 GGUF 배포본
학습 방식 · Tencent/Hy4-preview 기반 post-training mixed-precision quantization으로, STQ1_0 인코더에 imatrix 기반 weighted least-squares scale과 zero placement를 적용했습니다.
TL;DR
이 저장소는 Tencent/Hy4-preview를 기반으로 한 quantized GGUF 배포본으로, Q4_K_M·UD-IQ1_M·STQ1_0 세 가지 빌드를 제공합니다. STQ1_0은 3:4 sparsity와 ternary weight를 사용하고, imatrix를 반영한 weighted least-squares scale 및 zero placement로 2.38 bpw까지 압축합니다. Q4_K_M은 435.20 GiB, STQ1_0은 213.66 GiB이며, HY4 전용 architecture patch를 적용한 llama.cpp에서 실행해야 합니다. 8x H20 환경에서 STQ1_0은 prefill 204.56 ± 1.42 t/s, decode 20.47 ± 0.02 t/s를 기록했습니다.
핵심 포인트
- Tencent/Hy4-preview를 Q4_K_M·UD-IQ1_M·STQ1_0 세 가지 GGUF 형식으로 압축해 메모리 요구량별 선택지를 제공합니다.
- STQ1_0은 3:4 sparsity와 ternary weight를 사용하며, imatrix 기반 scale·zero 배치로 PTQ 오차를 줄입니다.
- 라우팅 expert가 전체 파라미터의 97.7%를 차지해 expert 계열에는 저비트 양자화를, residual stream에 직접 쓰는 계열에는 더 높은 정밀도를 배정합니다.
- HY4 전용 architecture patch와 CUDA용 llama.cpp 빌드가 필요하며, chat 실행에는 `--jinja` 옵션을 반드시 지정해야 합니다.
제한사항
- stock llama.cpp에는 `hyv4` architecture가 포함되지 않아 제공된 두 patch를 적용한 runtime이 필요합니다.
- 전체 weight를 GPU에 상주시키려면 Q4_K_M 약 435 GiB, STQ1_0 약 214 GiB의 VRAM이 필요하며, 부족하면 `-ngl`을 낮춰야 합니다.
- llama.cpp가 weight를 mmap하므로 NFS에서는 random page fault가 약 12 MB/s로 발생해 로딩 시간이 크게 늘어날 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| llama-bench STQ1_0 pp512 | prefill 처리량 | 204.56 ± 1.42 t/s | — |
| llama-bench STQ1_0 tg128 | decode 처리량 | 20.47 ± 0.02 t/s | — |
83
LIKES
93.7k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.