본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

PrismML-Eng/Bonsai-demo

Shell5 / 0

Bonsai-demo는 1-bit 및 ternary 양자화 Bonsai 계열 모델을 로컬에서 실행해 비전 입력과 OpenAI 스타일 도구 호출을 지원하는 데모 리포지토리다.

TL;DR

이 데모는 1-bit 및 ternary 양자화로 패킹된 Bonsai 계열 모델을 로컬에서 간편하게 설치하고 실행하는 용도로 설계되었다. setup 스크립트가 의존성 설치, 모델과 플랫폼별 바이너리 다운로드, MLX 빌드와 Open WebUI 통합을 자동으로 처리하며 27B는 비전 입력과 네이티브 도구 호출, 최대 262,144 토큰의 긴 문맥을 지원한다. 포맷 호환성 문제는 그룹 크기별 Q2_0 파일과 메인라인 또는 포크된 llama.cpp 바이너리의 조합으로 해결하며 CUDA 백엔드용 사전빌드 포크 바이너리를 포함해 즉시 실행을 보장한다. 트레이드오프는 높은 압축률을 통한 작은 풋프린트와 하드웨어별 호환성 관리가 필요하다는 점이며 실험적 옵션으로 speculative decoding과 4-bit KV cache를 통해 성능과 메모리 절감 조정이 가능하다.

핵심 포인트

  • 1-bit과 ternary(2-bit) 양자화 팩을 모두 제공해 극단적 압축과 품질 사이에서 선택할 수 있다.
  • 메인라인 llama.cpp 호환 파일과 포크된 그룹-128 Q2_0 파일을 함께 배포해 CUDA 등 일부 백엔드에서 즉시 실행 가능하게 구성했다.
  • 27B 비전언어 모델이 262,144 토큰의 초대형 문맥을 지원해 장기 대화와 문서 분석 워크로드를 처리할 수 있다.
  • 설치 스크립트가 MLX 빌드, Open WebUI 통합, Jupyter 기반 코드 인터프리터 구성까지 자동으로 수행해 데모 완성도를 높였다.

벤치마크

벤치마크지표비교
Context size limitmax_context_tokens262144
Bonsai-27B (1-bit) memory at 100K contextmemory_usage10.8 GiBvs 27B 16-bit: 55.2 GiB
Ternary-Bonsai-27B memory at 100K contextmemory_usage13.7 GiB

1.8k

STARS

171

FORKS

+207

TRENDING

5

조회수

watchers 1.8kopen issues 16Apache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.