본문으로 건너뛰기
r/LocalLLaMA조회 1

Bonsai와 Ternary 모델 생태계

Ternary-Bonsai-27B가 CUDA·Vulkan 지원과 CUDA 최적화를 확보했다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

저비트 로컬 모델 생태계에서 Bonsai와 Ternary-Bonsai-27B의 실행 지원이 확대됐다. Ternary-Bonsai-27B는 llama.cpp mainline에 CUDA와 Vulkan 지원이 병합됐고, CUDA 최적화로 토큰 생성 처리량 15~40%, 프롬프트 처리량 8% 향상이 기록됐다. 같은 목록에는 Mac Mini M4에서 200t/s 이상, iPhone에서 120t/s 이상을 기록한 Maple-Preview와 소비자용 노트북에서 최대 120t/s를 기록한 Mach-1-Additive-35B도 포함됐다. 작성자는 2026년 이전 모델을 제외하고 신규 저비트 모델과 관련 PR을 계속 추가할 계획이며, 주된 대상은 저사양 GPU 사용자다.

섹션별 상세

Bonsai는 4월부터 1-bit와 1.58-bit Ternary 버전으로 배포됐고, 7월에는 같은 형식의 27B 모델까지 추가됐습니다. Bonsai-27B는 지난달부터 모든 mainline 백엔드에서 실행됐지만, Ternary-Bonsai-27B는 일부 백엔드 지원이 늦어졌습니다. 이번 달에는 llama.cpp mainline에 CUDA와 Vulkan PR이 병합되면서 Ternary-Bonsai-27B의 실행 범위가 넓어졌습니다.
CUDA 최적화 PR이 병합되면서 Ternary Bonsai의 처리량이 토큰 생성 기준 15~40%, 프롬프트 처리 기준 8% 향상됐습니다. 이 변화는 모델 자체를 교체하기보다 CUDA용 연산 경로와 커널을 최적화해 입력 처리와 생성 단계의 병목을 줄이는 방식입니다. 따라서 1-bit·ternary 모델을 실제 GPU에서 구동하려는 사용자에게 mainline 지원과 실행 속도가 함께 개선된 사례가 됐습니다.
게시물은 Bonsai 외에도 BitCPM-CANN, Tencent의 Hy-MT1.5, Maple-Preview, Mach-1-Additive-35B, Neutrino-8B, Pestle-27B-Ternary를 함께 묶었습니다. Maple-Preview 20B-A1B는 Mac Mini M4에서 200t/s 이상, iPhone에서 120t/s 이상이라는 수치가 제시됐고, Mach-1-Additive-35B는 소비자용 노트북에서 최대 120t/s로 기재됐습니다. 모델별로 mainline PR이나 custom llama.cpp·MLX fork가 따로 있어 하드웨어와 실행기 조합에 따라 접근 경로가 달라집니다.
이미지 생성 영역에서는 Bonsai Image의 4B ternary·binary GGUF와 Clark Air Sana 1.6B 1.58bit가 목록에 포함됐습니다. 텍스트 모델뿐 아니라 이미지 모델에도 낮은 비트 수 표현을 적용한 배포물이 늘고 있다는 흐름입니다. 다만 게시물은 이 이미지 모델들의 품질 점수나 생성 속도 비교 수치를 제시하지 않았습니다.
추가 목록에는 abliterated Bonsai·Maple 모델, antidoom 변형, terna-e2b-GGUF가 포함됐고, llama.cpp에는 ARM NEON용 STQ1_0 ternary 커널과 TQ1_0·TQ2_0 zero-scale block 건너뛰기, VNNI 호환 CPU용 Q2_0 dot product 관련 PR이 남아 있습니다. VNNI PR에는 호환 CPU에서 3배 속도 향상이라는 설명이 붙어 있습니다. 작성자는 2026년 이전 모델은 제외했으며, 새로운 유사 모델과 PR을 확인하면 목록을 갱신하겠다고 밝혔습니다.

용어 해설

삼진 양자화(Ternary Quantization)
삼진 양자화는 모델 가중치를 세 가지 값으로 제한해 저장 공간과 메모리 사용량을 줄이는 방식입니다. 값이 0을 포함하므로 연산을 건너뛸 수 있고, 전용 커널과 결합하면 저사양 GPU·CPU에서 추론 속도를 높일 수 있습니다.
이진 양자화(Binary Quantization)
이진 양자화는 가중치를 두 가지 값으로 압축하는 방식입니다. 원래 수치 정밀도를 낮추는 대신 모델 크기와 메모리 대역폭 요구량을 줄이며, Bonsai 게시물에서는 1-bit 모델과 binary 이미지 모델에 적용된 사례로 등장합니다.
백엔드(Backend)
백엔드는 모델 추론을 실제 하드웨어에서 실행하는 구현 계층입니다. CUDA, Vulkan, CPU, Metal처럼 서로 다른 실행 환경에 맞춰 행렬·벡터 연산 커널을 제공하며, 같은 모델도 백엔드별 지원 여부와 속도가 달라질 수 있습니다.
GGUF
GGUF는 llama.cpp 계열 실행기에서 양자화 모델과 메타데이터를 함께 저장하는 파일 형식입니다. 게시물에 소개된 여러 모델은 GGUF 파일로 배포되며, CPU·CUDA·Metal 같은 백엔드에서 로컬 추론에 사용됩니다.

언급된 도구

llama.cpp중립링크

Bonsai 계열 양자화 모델을 CPU·CUDA·Vulkan·Metal 등 여러 백엔드에서 실행하는 추론 엔진이며, 모델별 지원을 위한 mainline PR과 custom fork가 함께 제시됐습니다.

MLX중립링크

Apple Silicon 계열에서 Maple-Preview를 실행하기 위한 프레임워크로, DeepGrove의 custom MLX fork가 링크됐습니다.

CUDA중립링크

Ternary-Bonsai-27B를 GPU에서 실행하는 백엔드이며, 지원 PR과 별도의 최적화 PR이 mainline에 병합됐습니다.

Vulkan중립링크

Ternary-Bonsai-27B 실행을 위한 그래픽스·GPU 백엔드로, llama.cpp mainline 지원 PR이 병합됐습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.