empero-ai/Qwen3.8-27B-Ridge-GGUF
Gated-DeltaNet 하이브리드 구조를 유지한 27B 멀티모달 모델의 저비트 GGUF 양자화27B262K 컨텍스트apache-2.0
Gated-DeltaNet 경로를 보존한 11.73 GiB Qwen3.8-27B GGUF 양자화 모델
학습 방식 · Qwen/Qwen3.8-27B를 기반으로 Gated-DeltaNet 상태 경로와 믹서를 구조에 맞게 배분한 Ridge mixed GGUF 저비트 양자화를 적용했습니다.
TL;DR
이 모델은 Qwen/Qwen3.8-27B를 기반으로 한 3.69 bpw 저비트 GGUF 양자화 모델이며, 주 파일 크기는 11.73 GiB입니다. Gated-DeltaNet 상태 경로를 Q8_0으로 유지하고 믹서는 Q4_K로 처리해 구조에 민감한 경로에 더 많은 비트를 배분했으며, native MTP draft head도 제거하지 않았습니다. Wiki-style PPL은 동일 체크포인트의 BF16 변환본 7.15 ± 0.12 대비 7.82 ± 0.14로 측정됐고, 이미지 입력에는 별도 BF16 mmproj가 필요합니다. 짧은 컨텍스트에서는 16~24 GB GPU를 시작점으로 삼을 수 있지만, 262,144 토큰 native context와 YaRN 확장에서는 KV cache가 주요 메모리 비용입니다.
핵심 포인트
- Gated-DeltaNet 상태 경로를 Q8_0으로 보존해 저비트 양자화의 민감한 부분을 보호합니다. 믹서는 Q4_K를 사용하고 중간층 FFN에서 비트를 절약합니다. 단순한 2비트 양자화 파일과 구성이 다릅니다.
- 공식 Qwen/Qwen3.8-27B 체크포인트를 3.69 bpw로 압축했습니다. 주 모델 파일은 11.73 GiB이며 텍스트 입력을 처리합니다. 이미지 입력에는 별도의 0.87 GiB BF16 mmproj 파일이 필요합니다.
- native MTP draft head인 blk.64와 nextn을 GGUF에 그대로 포함했습니다. 최근 llama.cpp에서 draft-mtp를 활성화하면 초안 기반 Speculative Decoding을 사용할 수 있습니다. 지원하지 않는 런타임에서는 일반 27B 모델로 동작합니다.
- 짧은 테스트에서 RTX PRO 6000 Blackwell 96 GB 기준 생성 약 54 tok/s와 프롬프트 약 130 tok/s를 기록했습니다. 이는 단일 GPU에서 측정한 한 번의 결과입니다. 16~24 GB GPU에서는 짧은 컨텍스트 기준으로 실용적인 구성이지만 긴 컨텍스트에서는 KV cache가 메모리를 크게 차지합니다.
제한사항
- BF16 변환본과 비교한 Wiki-style PPL이 7.15 ± 0.12에서 7.82 ± 0.14로 증가해 손실 없는 변환이 아닙니다. 측정상 BF16 대비 PPL이 9.3% 높습니다. 따라서 원본 BF16과 동일한 수치 정밀도가 필요한 용도에는 적합하지 않습니다.
- 11.73 GiB의 가중치 크기만으로 전체 메모리 요구량을 판단할 수 없습니다. 컨텍스트가 길어지면 KV cache가 주요 메모리 비용이 됩니다. 이미지 입력에서는 BF16 mmproj 약 0.87 GiB도 추가됩니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Wiki-style PPL | perplexity | 7.82 ± 0.14 | 동일 공식 체크포인트를 변환한 BF16 GGUF의 7.15 ± 0.12 대비 +9.3%; llama-perplexity, 80개 512-token 청크, -c 512 -b 512 측정 |
| RTX PRO 6000 Blackwell 96 GB 단일 GPU 테스트 | generation speed | 약 54 tok/s | llama.cpp CUDA, -ngl 99, 짧은 smoke 테스트에서 측정한 단일 데이터 포인트 |
| RTX PRO 6000 Blackwell 96 GB 단일 GPU 테스트 | prompt processing speed | 약 130 tok/s | llama.cpp CUDA, -ngl 99, 짧은 smoke 테스트에서 측정한 단일 데이터 포인트 |
83
Likes
3.4k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.