3.9GB로 배포되는 1비트 Bonsai 27B, 262K 토큰 컨텍스트 탑재
Qwen3.6-27B 기반을 1.125비트 GGUF로 압축해 3.9GB로 배포 가능한 27B급 추론과 262K 토큰 컨텍스트를 제공하는 모델이다.
TL;DR
Bonsai 27B는 Qwen3.6-27B 아키텍처를 유지한 채 GGUF Q1_0_g128 포맷으로 가중치를 1.125비트 수준으로 패킹해 약 3.9GB로 배포 가능한 27B급 모델이다. 하이브리드 어텐션(약 75% 선형)과 4비트 KV 캐시 양자화를 결합해 최대 262K 토큰 컨텍스트를 온디바이스에서 유지할 수 있으며 DSpark 드래프터를 통해 서버 경로에서 디코드 속도도 개선했다. 벤치마크는 전체 thinking 평균 76.11을 보고해 FP16 대비 약 89.5%의 성능을 유지했음을 보이며 수학과 코딩 계열은 특히 강한 회복력을 보였다. 이 모델은 메모리·전력·프라이버시 제약이 있는 환경에서 27B급 추론을 실용화하는 대신 일부 고난도 카테고리에서 성능 마진을 희생한 트레이드오프를 택했다. 최종적으로 용량 대비 지능 밀도 측면에서 유의미한 이득을 제공하나, 에이전트형 장기 코드 워크플로우 등 특정 고품질 요구 사례는 여전히 더 큰 정밀도의 변형을 권장한다.
핵심 역량
- Bonsai 27B는 수십만 토큰(262K)의 긴 문맥을 유지하면서 추론과 생성 작업을 수행할 수 있다. 하이브리드 어텐션 구조와 4비트 KV 캐시 양자화를 통해 높은 컨텍스트 길이를 실현했고, 이로 인해 긴 문서 분석이나 전체 코드 저장소를 맥락으로 둔 작업이 가능하다. 또한 온디바이스 배포를 전제로 설계되어 노트북과 모바일에서 실제 응답을 얻을 수 있다.
- 이 모델은 수학·코딩·지식·추론 계열의 태스크에서 FP16 대비 제한된 성능 손실 범위 내에서 동작한다. README의 측정에서는 수학 계열에서 91.66, 코딩에서 81.88 등 특정 카테고리에서 준수한 성능을 유지했으며 전반적 thinking average는 76.11으로 보고되었다. 따라서 정밀도가 약간 감소해도 메모리·전력 제약 환경에서 실용적 성능을 제공한다.
- 온디바이스·프라이버시 민감한 사용 사례에서 로컬 추론이 가능하며 DSpark 드래프터를 통해 서버 경로에서 디코딩 속도를 개선할 수 있다. 드래프터를 활성화한 CUDA 경로에서는 1.37배의 엔드투엔드 디코드 속도 향상이 보고되었고 모바일 경로용 MLX 빌드도 별도 제공되어 iPhone 등 모바일 기기에서 동작할 수 있다. 이러한 배포 옵션은 오프라인 및 저지연 요구를 가진 응용에 적합하다.
강점
- 극단적인 용량 축소를 달성해 전체 27B 계열 모델을 약 3.9GB로 배포 가능하게 만들었고, 이로 인해 표준 노트북과 모바일에서 27B급 추론이 현실화되었다. README 측정치는 FP16 대비 약 14.2배 작은 배포 크기를 보고하며 온디바이스 환경에서의 실사용 가능성을 보여주었다. 경량화에도 불구하고 수학과 코딩 같은 핵심 추론 능력은 큰 손실 없이 유지되었다는 점이 장점이다.
- 긴 문맥 처리에 집중한 아키텍처 조합(하이브리드 어텐션 + 4비트 KV 캐시)으로 262K 토큰 윈도우를 실용적 메모리 예산에서 지원한다. README의 피크 메모리 표는 1비트 빌드가 100K 토큰에서 11.6GB, KV 캐시 압축을 적용하면 100K에서 6.8GB로 낮아지는 수치를 제시해 긴 문맥 워크로드에 대한 실사용 근거를 제공한다. 이 특성은 긴 문서, 코드베이스 분석, 에이전트형 워크플로우의 상태 유지에 유리하다.
- 서빙 경로에서 DSpark 드래프터를 통해 디코드 속도를 개선할 수 있어 실전 응답성 측면에서 장점을 갖는다. README에 따르면 H100 환경에서 드래프터 활성화로 104.8 → 143.8 tok/s로 1.37배 향상이 보고되었으며 드래프터의 검증 단계는 출력 분포를 보존한다. 따라서 서버 측 처리량을 높이면서 출력 품질을 유지하는 실용적 이득이 존재한다.
훈련 방식
모델은 Qwen3.6-27B를 기반으로 아키텍처를 변경하지 않고 가중치 표현을 GGUF Q1_0_g128로 변환하는 방식으로 제작되었다. README는 전체 가중치(임베딩, 어텐션·MLP 프로젝션, LM 헤드)를 1비트화해 패킹하는 방식을 핵심으로 명시하고 있으며 이 과정에서 그룹별 FP16 스케일을 유지해 실효 비트폭을 확보했다고 기술했다. DSpark 드래프터는 드래프팅과 검증 흐름을 위해 별도로 학습된 보조 블록으로서 서빙 성능을 높이는 데 사용된다.
알아두면 좋은 것
- 모델은 Qwen3.6-27B를 기반으로 아키텍처는 유지하되 가중치를 GGUF Q1_0_g128 포맷으로 패킹해 전체 배포 크기를 약 3.9GB로 줄였다. 이 포맷은 각 128개 그룹에 하나의 FP16 스케일을 공유하고 가중치는 부호 비트로만 저장해 실효 1.125비트를 달성한다. 배포 시점에서 가중치를 FP16으로 복원하지 않고 패킹된 상태로 바로 소비하는 것이 설계 목표이다.
- 하이브리드 어텐션(약 75% 선형, 25% 완전 어텐션)과 4비트 KV 캐시 양자화를 조합해 262K 토큰의 컨텍스트를 온디바이스에서 현실적인 메모리 예산으로 유지한다. KV 캐시를 4비트로 줄이면 컨텍스트에 따른 피크 메모리가 약 4배 줄어들며 전체 262K 창을 약 9.4GB 피크에서 운영 가능하게 만든다. 이 조합은 긴 대화나 전체 레포지토리 분석을 처리하는 워크로드에 직접적인 이점을 제공한다.
- DSpark 드래프터는 6층 경량 블록-병렬 트랜스포머로 타깃 모델의 중간 히든 상태를 활용해 초안 생성을 수행하고 검증을 통해 품질을 보존하는 방식이다. 드래프터는 4비트로 양자화된 기본 패크를 기본 제공하여 서빙 경로에서 속도 이득을 달성하며, 검증 단계는 출력 분포를 보존하므로 정확도에 영향을 주지 않는다. CUDA 경로에서 측정된 이득은 H100 기준으로 1.37x의 디코드 속도 개선이었다.
- 배포 컴포넌트로는 1비트 언어 모델 패크 외에 선택적 Q4_1 양자화 드래프터와 4비트 HQQ 비전 타워가 있으며 비전 타워는 이미지 입력 시에만 로드하도록 설계되었다. 이로 인해 텍스트 전용 서비스는 비전 관련 메모리 비용을 부담하지 않으며 멀티모달 기능은 필요 시 선택적으로 활성화할 수 있다. 라이선스는 Apache 2.0으로 상업적 사용과 재배포에 친화적이다.
기술적 특징
- 가중치 표현은 GGUF Q1_0_g128 포맷으로 설계되어 각 128개 가중치 그룹에 하나의 FP16 스케일을 공유하고 각 가중치는 부호 비트로만 저장된다. 이로 인해 저장된 비트 폭은 실효적으로 1.125비트가 되며 저장 용량과 가중치 트래픽이 크게 감소한다. 패킹된 상태로 추론 커널이 가중치를 직접 소비하도록 구현되어 배포 시점에서 FP16으로 복원하지 않는다.
- 아키텍처는 Qwen3.6-27B의 하이브리드 어텐션을 유지해 약 75% 선형 어텐션과 25% 완전 어텐션으로 구성되며 이는 긴 컨텍스트에서 계산/메모리 효율을 제공한다. 선형 어텐션 레이어가 컨텍스트 확장성을 책임지며 소수의 완전 어텐션 레이어가 장기적인 상호작용과 복잡한 의존성을 포착한다. 이 설계는 262K 토큰 윈도우를 실용적 메모리 예산으로 유지하는 데 핵심적 역할을 한다.
- KV 캐시를 4비트로 양자화해 컨텍스트 관련 피크 메모리를 크게 줄였고 필요한 경우 더 낮은 비트폭으로 추가 압축이 가능하다고 명시했다. 4비트 양자화 적용 시 100K 토큰 피크는 약 11.6GB에서 6.8GB로 줄어들고 전체 262K 윈도우는 약 9.4GB로 맞출 수 있다. 이 방식은 긴 대화를 유지하거나 대형 레포지토리를 한 번에 콘텍스트로 올리는 작업에서 메모리 장벽을 낮춘다.
- 서빙 성능 개선을 위해 DSpark라는 추측적 디코딩 드래프터를 도입했고 드래프터는 타깃 모델의 중간 히든을 탭해 초안을 생성한 뒤 검증 단계에서 타깃 분포를 보존한다. 드래프터는 6층 블록-병렬 트랜스포머로 설계되었고 기본 제공 패크는 4비트 형식으로 용량과 처리 비용을 절감한다. CUDA 경로에서는 드래프터 사용으로 엔드투엔드 디코드가 1.37배 빨라졌고 검증은 품질을 보존하므로 속도와 정확도 트레이드오프를 피했다.
- 모델은 패킹된 1비트 가중치를 직접 소비하는 커스텀 low-bit 커널과 함께 llama.cpp(CUDA, Metal, CPU) 백엔드를 통해 실행되도록 설계되었다. 이 커널들은 가중치를 FP16으로 확장하지 않고도 연산을 수행해 런타임 메모리와 대역폭 부담을 줄인다. 또한 MLX 포크를 통해 Apple Silicon에서의 네이티브 실행을 제공해 모바일 배포 경로를 확보했다.
차별점
- 배포 크기를 약 3.9GB로 줄여 27B급 모델을 표준 노트북과 일부 모바일 기기에서 직접 실행할 수 있게 만든 점이 핵심 차별화 요소이다. 이는 그룹 스케일링 기반의 Q1_0_g128 포맷을 통해 가능한 것으로서 일반적인 '4-bit' 빌드보다 훨씬 작은 실배포 용량을 달성했다. 결과적으로 동일 계열의 다른 양자화 빌드들이 장치에 적재조차 못하는 상황에서 27B급 추론이 가능해졌다.
- 하이브리드 어텐션과 4비트 KV 캐시 조합으로 262K 토큰의 긴 컨텍스트를 실용적 메모리 예산으로 지원하는 점이 다른 경량화 빌드와 구별된다. 많은 저비트 빌드가 장기적 추론 품질에서 붕괴하는 반면 이 설계는 긴 체인오브소고리(reasoning chain)를 유지하도록 균형을 맞췄다. 따라서 긴 문서 처리와 장기 상태 유지가 요구되는 워크플로에서 실무적 이점을 제공한다.
- 서빙 측면에서 DSpark 드래프터를 통해 검증 보장(lossless verification)을 유지하면서도 실질적인 디코드 속도 향상을 얻은 점이 운영적 차별점이다. 드래프터는 서빙 스택의 검증 비용 모델을 반영해 초안 깊이와 블록 크기를 조정하므로 품질 손실 없이 처리량을 늘릴 수 있다. 이 접근법은 서버형·온디바이스형 경로 모두에서 응답성 최적화 옵션을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Thinking average (15 benchmarks) | average | 76.11 | vs FP16: 85.07 (89.5%) |
| Math (GSM8K/MATH/AIME) | math avg | 91.66 | reported in README |
| Coding (HumanEval+/MBPP+/LiveCodeBench) | coding avg | 81.88 | reported in README |
701
Likes
2.5M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.