prism-ml/Bonsai-27B-gguf
27B급 추론 능력을 3.9GB로 압축해 노트북과 휴대폰에서도 돌리는 1비트 양자화 모델
학습 방식 · Qwen3.6-27B를 기반으로 임베딩·어텐션·MLP·LM head까지 전 영역을 1.125비트(Q1_0_g128)로 양자화하고, 타깃에 맞춰 학습한 DSpark 추론적 디코딩 드래프터를 함께 배포했다.
TL;DR
1-bit Bonsai 27B는 Qwen3.6-27B의 임베딩·어텐션·MLP·LM head 전체를 진짜 1.125비트(GGUF Q1_0_g128)로 양자화해 FP16 대비 약 14.2배 작은 3.9GB 패키지로 만든 모델로, 라벨과 실제 비트폭이 일치하는 몇 안 되는 저비트 빌드다. 75% 선형 어텐션 하이브리드 백본과 4비트 KV 캐시 덕분에 262K 토큰 컨텍스트도 노트북 메모리 예산 안에서 유지되며, 타깃에 맞춰 학습한 DSpark 추론적 디코딩 드래프터를 붙이면 H100에서 무손실로 1.37배 빨라진다. thinking mode 15개 벤치마크 평균이 FP16의 89.5%(76.11점)로, 수학·코딩은 몇 점 차이로 근접하지만 에이전틱 툴 사용과 비전에서는 격차가 더 크게 나타난다. Apple M5 Max에서 초당 66토큰, iPhone 17 Pro Max에서도 MLX Swift로 약 11토큰을 내 27B급 모델을 처음으로 휴대폰에서 돌릴 수 있게 했지만, 장기·다중 파일 에이전틱 코딩은 아직 강점이 아니다.
핵심 포인트
- 가중치를 부호 1비트로 표현하는 진짜 1.125비트 양자화로, 라벨과 실제 비트폭이 일치하는 몇 안 되는 저비트 빌드다.
- 3.9GB 배포 용량으로 27B급 추론을 노트북·단일 GPU는 물론 iPhone(MLX)에서도 구동할 수 있게 한다.
- 4비트 KV 캐시와 75% 선형 어텐션 백본 덕분에 262K 컨텍스트를 노트북 메모리 예산 안에서 유지한다.
- DSpark 드래프터를 얹으면 H100에서 무손실 1.37배 디코드 가속을 얻는다.
제한사항
- thinking mode 15개 벤치마크 평균이 FP16의 89.5%로, 특히 에이전틱 툴 사용(66.03)과 비전(59.57)에서 격차가 크다.
- 장기·다중 파일 에이전틱 코딩 워크플로에는 아직 강점을 보이지 않으며 전용 튜닝은 로드맵 상에 있다.
- 품질을 더 중시한다면 같은 계열의 ternary(실효 1.71비트) 빌드가 94.6%로 더 높은 보존율을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Thinking mode 15개 벤치마크 평균 | score | 76.11 | FP16 85.07 대비 89.5% |
| 수학(GSM8K·MATH-500·AIME) | average | 91.66 | FP16 95.33 |
| 코딩(HumanEval+·MBPP+·LiveCodeBench) | average | 81.88 | FP16 88.74 |
| 배포 용량 | size | 3.9GB | FP16 54GB 대비 14.2배 축소 |
| Apple M5 Pro 생성 속도 | TG128 | 44.2 tok/s | — |
728
LIKES
2.6M
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.