본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

prism-ml/Ternary-Bonsai-27B-mlx-2bit

이 모델은 주로 텍스트 생성과 장기 문맥 추론을 목표로 설계되었으며, 고난도 수리·코딩·에이전트적 도구 호출과 같은 'thinking mode' 워크로드를 지원한다. 262K 토큰 컨텍스트를 활용해 긴 문서, 리포지토리 전체, 대화 히스토리를 하나의 컨텍스트로 유지하면서 생성 품질을 유지하는 것이 핵심 목표였다. 텍스트 입력 중심의 일괄 생성과 상호작용적 디코딩 모두를 운영 가능한 메모리 예산 내에서 수행하도록 최적화되었다.~27.3B262K 컨텍스트apache-2.0

Ternary Bonsai 27B는 Qwen3.6-27B를 기반으로 전체 가중치를 테너리 g128로 표현해 약 7.2GB로 배포하고 262K 토큰 컨텍스트와 온디바이스 추론을 실현한 모델이다.

학습 방식 · 기본적으로 Qwen3.6-27B를 기반으로 하며 모델 전체를 테너리 g128 표현으로 재표현하고 그룹별 FP16 스케일을 적용해 저비트로 재포장한 방식으로 제작되었으며, 실사용 벤치마크와 DSpark 드래프터 학습을 통해 디코드 경로 성능을 보정했다.

TL;DR

이 모델은 Qwen3.6-27B를 기반으로 모델 전체 가중치를 테너리 g128로 재표현해 배포 크기를 약 7.2GB로 줄이면서도 262K 토큰의 장기 컨텍스트를 실현한 저비트 LLM이다. 테너리 표현은 그룹별 FP16 스케일을 활용해 가중치를 {−1,0,+1}으로 압축하고 CUDA·Apple MLX용 저비트 커널로 패킹된 슬롯을 직접 소비하도록 설계되어 메모리 대역폭 중심의 실행에서 효율을 끌어올린다. DSpark speculative-decoding 드래프터와 4-bit KV 캐시 양자화를 결합해 CUDA 경로에서는 디코드 속도 1.34x 개선과 피크 메모리 절감을 관측했으며, 15개 thinking-mode 평균에서 FP16 대비 94.6%의 성능을 유지했다. 네이티브 테너리 커널 도입 전까지는 배포 크기가 이론적 한계보다 다소 높고, 폰급 메모리 예산에는 맞지 않는다는 한계가 존재한다.

핵심 포인트

  • 모델 전체의 임베딩·어텐션·MLP·LM 헤드까지 일관되게 테너리로 표현한 점이 다른 저비트 빌드와 구분된다.
  • 하이브리드 어텐션과 4-bit KV 캐시 양자화를 결합해 262K 토큰이라는 매우 긴 컨텍스트를 실용적으로 유지할 수 있도록 설계되었다.
  • DSpark 드래프터를 기본 패키지로 제공해 서빙 경로에서 검증 기반의 lossless speculative decoding으로 디코드 속도를 개선했다.
  • 배포 크기가 약 7.2GB로 표준 노트북이나 단일 GPU에서 27B 급 추론이 가능하다는 점에서 실용적 이점을 제공한다.

벤치마크

벤치마크지표비교
Thinking average (15)score80.49vs FP16: 94.6%
Math (GSM8K, MATH-500, AIME25/26)score93.40within ~2 points of FP16
Coding (HumanEval+, MBPP+, LiveCodeBench)score85.96high retention vs FP16
Deployed footprintsize~7.2 GBideal ternary size 5.9 GB

144

LIKES

27.6k

DOWNLOADS

3 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.