prism-ml/Ternary-Bonsai-27B-mlx-2bit
Ternary Bonsai 27B는 Qwen3.6-27B를 기반으로 전체 가중치를 테너리 g128로 표현해 약 7.2GB로 배포하고 262K 토큰 컨텍스트와 온디바이스 추론을 실현한 모델이다.
학습 방식 · 기본적으로 Qwen3.6-27B를 기반으로 하며 모델 전체를 테너리 g128 표현으로 재표현하고 그룹별 FP16 스케일을 적용해 저비트로 재포장한 방식으로 제작되었으며, 실사용 벤치마크와 DSpark 드래프터 학습을 통해 디코드 경로 성능을 보정했다.
TL;DR
이 모델은 Qwen3.6-27B를 기반으로 모델 전체 가중치를 테너리 g128로 재표현해 배포 크기를 약 7.2GB로 줄이면서도 262K 토큰의 장기 컨텍스트를 실현한 저비트 LLM이다. 테너리 표현은 그룹별 FP16 스케일을 활용해 가중치를 {−1,0,+1}으로 압축하고 CUDA·Apple MLX용 저비트 커널로 패킹된 슬롯을 직접 소비하도록 설계되어 메모리 대역폭 중심의 실행에서 효율을 끌어올린다. DSpark speculative-decoding 드래프터와 4-bit KV 캐시 양자화를 결합해 CUDA 경로에서는 디코드 속도 1.34x 개선과 피크 메모리 절감을 관측했으며, 15개 thinking-mode 평균에서 FP16 대비 94.6%의 성능을 유지했다. 네이티브 테너리 커널 도입 전까지는 배포 크기가 이론적 한계보다 다소 높고, 폰급 메모리 예산에는 맞지 않는다는 한계가 존재한다.
핵심 포인트
- 모델 전체의 임베딩·어텐션·MLP·LM 헤드까지 일관되게 테너리로 표현한 점이 다른 저비트 빌드와 구분된다.
- 하이브리드 어텐션과 4-bit KV 캐시 양자화를 결합해 262K 토큰이라는 매우 긴 컨텍스트를 실용적으로 유지할 수 있도록 설계되었다.
- DSpark 드래프터를 기본 패키지로 제공해 서빙 경로에서 검증 기반의 lossless speculative decoding으로 디코드 속도를 개선했다.
- 배포 크기가 약 7.2GB로 표준 노트북이나 단일 GPU에서 27B 급 추론이 가능하다는 점에서 실용적 이점을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Thinking average (15) | score | 80.49 | vs FP16: 94.6% |
| Math (GSM8K, MATH-500, AIME25/26) | score | 93.40 | within ~2 points of FP16 |
| Coding (HumanEval+, MBPP+, LiveCodeBench) | score | 85.96 | high retention vs FP16 |
| Deployed footprint | size | ~7.2 GB | ideal ternary size 5.9 GB |
144
LIKES
27.6k
DOWNLOADS
3 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.