본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

prism-ml/Ternary-Bonsai-27B-gguf

Qwen3.6-27B를 ternary(1.71비트)로 양자화해 노트북·단일 GPU에서 구동하는 품질 지향 텍스트 생성 모델(llama.cpp GGUF)27.3B262K 컨텍스트apache-2.0

FP16 지능의 94.6%를 7.2GB에 담아 노트북에서 돌리는 ternary 양자화 27B 모델

학습 방식 · Qwen3.6-27B를 기반으로 임베딩·어텐션·MLP·LM head를 1.71비트 ternary(Q2_0_g128)로 양자화하고 DSpark 추론적 디코딩 드래프터를 함께 학습했다.

TL;DR

Ternary Bonsai 27B는 같은 Qwen3.6-27B를 {-1,0,+1} 세 값을 쓰는 ternary 표현(GGUF Q2_0_g128, 실효 1.71비트)으로 양자화해 FP16 대비 약 9.4배 작은 7.2GB 패키지로 만든, Bonsai 계열의 품질 지향 지점이다. 여분의 0 상태 덕분에 1비트판보다 표현력이 커 thinking mode 15개 벤치마크 평균이 FP16의 94.6%(80.49점)에 달하며, 이는 용량이 더 큰 IQ2_XXS(9.4GB, 72.73점)보다도 높은 점수다. 262K 컨텍스트와 4비트 KV 캐시, DSpark 추론적 디코딩 드래프터(H100에서 무손실 1.34배 가속)를 1비트판과 동일하게 지원해 노트북이나 단일 GPU에서 27B급 추론을 실용적으로 돌릴 수 있다. 다만 약 7.2GB라는 배포 용량이 iOS 앱당 메모리 예산을 넘어 휴대폰에는 맞지 않으므로, 폰 배포에는 1비트 companion을 대신 써야 한다.

핵심 포인트

  • {-1,0,+1} 3값을 쓰는 ternary 표현이 1비트보다 표현력이 커 FP16 지능의 94.6%를 보존하는 품질 지향 지점이다.
  • 7.2GB로 IQ2_XXS(9.4GB)보다 작으면서도 더 높은 점수를 내 동급 저비트 빌드 대비 밀도가 2배 높다.
  • 262K 컨텍스트와 4비트 KV 캐시를 지원해 100K 토큰 문서도 15GB 이하 피크 메모리로 처리한다.
  • DSpark 드래프터로 H100에서 무손실 1.34배 디코드 가속을 얻는다.

제한사항

  • 약 7.2GB 배포 용량이 iOS 앱당 메모리 예산(~6GB)을 넘어 휴대폰 배포에는 부적합하며, 휴대폰용은 1비트 버전을 써야 한다.
  • 현재 커널은 ternary 값을 2비트 슬롯에 저장해 이론적 최소(5.9GB)보다 큰 7.2GB를 실제로 사용한다.
  • 장기·다중 파일 에이전틱 코딩 워크플로에는 아직 강점을 보이지 않는다.

벤치마크

벤치마크지표비교
Thinking mode 15개 벤치마크 평균score80.49FP16 85.07 대비 94.6%, IQ2_XXS(72.73) 초과
수학 평균score93.40FP16 95.33
코딩 평균score85.96FP16 88.74
배포 용량size7.2GBFP16 54GB 대비 9.4배 축소

1.2k

LIKES

761.3k

DOWNLOADS

3 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.