prism-ml/Bonsai-27B-mlx-1bit
Qwen3.6-27B를 기반으로 모든 언어 가중치를 1.125비트 Binary g128로 재표현해 3.9GB 배포와 262K 토큰 컨텍스트를 달성한 27B급 온디바이스 생성 모델이다.
학습 방식 · 기본적으로 Qwen3.6-27B 아키텍처를 유지한 채로 전체 언어 가중치를 Binary g128 형식으로 변환·재포장한 빌드이다. DSpark drafter는 저비트 타겟을 학습 목표로 별도 훈련되어 speculative decoding과 검증 워크플로를 따른다. 훈련과 최적화는 저비트 표현의 정밀도와 그룹 스케일 방식을 맞추는 데 초점을 두었다.
TL;DR
Bonsai 27B는 Qwen3.6-27B를 기반으로 모든 언어 가중치를 Binary g128 네이티브 포맷으로 재표현해 3.9GB 배포 크기와 262K 토큰 컨텍스트를 달성한 27B급 온디바이스 생성 모델이다. 가중치의 부호 비트와 그룹 단위 FP16 스케일을 사용해 실효 1.125 bits/weight를 확보했고, 하이브리드 어텐션과 4-bit KV 캐시 양자화로 긴 문맥을 유지하면서도 메모리 요구를 통제했다. 커널 수준에서 가중치를 풀어쓰지 않는 MLX/CUDA 구현과 DSpark speculative drafter의 조합으로 모바일과 서버 환경에서 실용적인 처리량과 무손실 디코딩 가속을 제공한다. 이 설계는 수학과 코딩 같은 고난도 항목에서 FP16 대비 근접한 성능을 유지하면서도 처음으로 27B급 모델을 스마트폰 수준 메모리 예산에서 실행 가능하게 했지만, 에이전트적 장기 코딩 워크플로와 모바일의 지속적 스로틀링 같은 제한은 여전히 존재한다.
핵심 포인트
- 전체 언어 가중치를 네이티브 1-bit Binary g128로 유지해 FP16 대비 약 14.2배 작은 배포 크기와 1.125 bits/weight의 정직한 비트율을 달성했다. 이 접근은 가중치를 풀어쓰지 않고 커널에서 직접 소비하므로 메모리 피크와 대역폭 비용을 동시 절감한다. 그 결과 처음으로 27B급 모델을 스마트폰 수준의 per-app 메모리 예산 내에서 실행 가능하게 했다.
- 하이브리드 어텐션과 4-bit KV 캐시 양자화를 결합해 262K 토큰이라는 매우 긴 컨텍스트를 실용적으로 제공했다. 선형 어텐션이 긴 창을 지원하고 일부 레이어의 full-attention이 정밀도를 보존하는 방식으로 품질과 확장성을 균형시켰다. 이 조합은 긴 문서 분석과 멀티턴 에이전트 워크플로에서의 실용적 이점을 만든다.
- 서버 측에서는 DSpark drafter를 통해 손실 없는 speculative decoding 가속을 제공해 CUDA 환경에서 실측 1.37x 디코딩 속도 향상을 확보했다. drafter는 초안 생성과 검증을 분리해 합치면 출력 분포를 보존하면서 처리량을 높인다. 온디바이스에서는 검증 오버헤드로 기본 활성화가 아니지만 서버·CUDA 경로에서 명확한 실이득을 만든다.
- 온디바이스 27B급 실행을 처음으로 실현한 사례로서 모델 파일이 3.9GB에 불과해 고성능 스마트폰의 per-app 메모리 예산에 적합하다. 네이티브 Binary g128 포맷과 4-bit KV 캐시 조합으로 긴 컨텍스트 처리까지 가능해 사용 사례 범위가 넓다. 이로 인해 로컬 프라이버시와 오프라인 추론, 저지연 응답이 가능한 환경에서 활용도가 높다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Thinking avg (15) | score | 76.11 | vs FP16: 89.5% |
| Deployed footprint | size | 3.9 GB | 14.2x smaller than FP16 |
| iPhone 17 Pro Max throughput | tg128 (tok/s) | 11.0 | measured peak, thermally limited in sustained runs |
177
LIKES
37k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.