본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

AngelSlim/Hy4-preview-GGUF

대화형 언어 생성

Hy4-preview를 전용 patch와 혼합 정밀도 quantization으로 약 214GiB까지 줄인 GGUF 배포본

학습 방식 · Tencent/Hy4-preview 기반 post-training mixed-precision quantization으로, STQ1_0 인코더에 imatrix 기반 weighted least-squares scale과 zero placement를 적용했습니다.

TL;DR

이 저장소는 Tencent/Hy4-preview를 기반으로 한 quantized GGUF 배포본으로, Q4_K_M·UD-IQ1_M·STQ1_0 세 가지 빌드를 제공합니다. STQ1_0은 3:4 sparsity와 ternary weight를 사용하고, imatrix를 반영한 weighted least-squares scale 및 zero placement로 2.38 bpw까지 압축합니다. Q4_K_M은 435.20 GiB, STQ1_0은 213.66 GiB이며, HY4 전용 architecture patch를 적용한 llama.cpp에서 실행해야 합니다. 8x H20 환경에서 STQ1_0은 prefill 204.56 ± 1.42 t/s, decode 20.47 ± 0.02 t/s를 기록했습니다.

핵심 포인트

  • Tencent/Hy4-preview를 Q4_K_M·UD-IQ1_M·STQ1_0 세 가지 GGUF 형식으로 압축해 메모리 요구량별 선택지를 제공합니다.
  • STQ1_0은 3:4 sparsity와 ternary weight를 사용하며, imatrix 기반 scale·zero 배치로 PTQ 오차를 줄입니다.
  • 라우팅 expert가 전체 파라미터의 97.7%를 차지해 expert 계열에는 저비트 양자화를, residual stream에 직접 쓰는 계열에는 더 높은 정밀도를 배정합니다.
  • HY4 전용 architecture patch와 CUDA용 llama.cpp 빌드가 필요하며, chat 실행에는 `--jinja` 옵션을 반드시 지정해야 합니다.

제한사항

  • stock llama.cpp에는 `hyv4` architecture가 포함되지 않아 제공된 두 patch를 적용한 runtime이 필요합니다.
  • 전체 weight를 GPU에 상주시키려면 Q4_K_M 약 435 GiB, STQ1_0 약 214 GiB의 VRAM이 필요하며, 부족하면 `-ngl`을 낮춰야 합니다.
  • llama.cpp가 weight를 mmap하므로 NFS에서는 random page fault가 약 12 MB/s로 발생해 로딩 시간이 크게 늘어날 수 있습니다.

벤치마크

벤치마크지표비교
llama-bench STQ1_0 pp512prefill 처리량204.56 ± 1.42 t/s
llama-bench STQ1_0 tg128decode 처리량20.47 ± 0.02 t/s

83

LIKES

93.7k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.