본문으로 건너뛰기

nucleo의 Bonsai-8B ARM 추론 성능 비교

nucleo가 무료 ARM 인스턴스에서 Bonsai-8B 추론 속도와 검증 결과를 공개했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Bonsai-8B를 실행하는 nucleo가 Oracle Always-Free ARM 환경에서 llama.cpp fork보다 빠른 결과를 냈다. 2코어에서 decode 2.8 tok/s와 prompt processing 4.3 tok/s를 기록했고, 4코어에서는 각각 5.3 tok/s와 7.7 tok/s에 도달했다. 2.125bpw 인터리브 형식과 128개 가중치 블록을 처리하는 NEON int32 커널이 핵심 구현이며, 19/20 정확도와 149개 테스트 사례가 함께 제시됐다. 다만 1.7B 모델과 M3에서는 mainline llama.cpp가 더 빠르므로 이번 결과는 특정 Bonsai-8B·ARM 조합에 한정된다.

주요 논점

01찬성소수

동일 하드웨어와 프롬프트를 사용한 반복 측정에서 nucleo가 2코어와 4코어 모두 decode 및 prompt processing 속도를 앞섰다. 4코어 decode가 연속 실행에서 5.3 tok/s로 유지됐고, 라이브 데모가 같은 무료 ARM 환경에서 실제 모델을 실행한다. 테스트 수와 assertion 수, 공개된 벤치마크 자료까지 제공되어 특정 환경에서의 성능 주장을 재현할 근거가 있다.

02중립소수

nucleo의 우위는 무료 ARM 인스턴스와 Bonsai-8B 조합에 한정되며, 모든 삼항 모델과 하드웨어에서 더 빠르다는 뜻은 아니다. 1.7B 모델과 M3 Apple Silicon에서는 mainline llama.cpp가 더 좋은 결과를 냈다. 따라서 엔진의 전반적인 우열보다 실행 환경과 커널 구현에 따른 성능 차이로 해석해야 한다.

합의점 vs 논쟁점

논쟁점

  • nucleo가 특정 2코어·4코어 ARM 환경에서 llama.cpp fork보다 빠르다는 벤치마크 결과와, 2.125bpw 변환 및 NEON int32 누적을 사용하는 구현 방식이 핵심 근거로 제시됐다. 그러나 1.7B 모델과 M3에서는 llama.cpp가 앞서므로 결과를 모든 모델과 하드웨어로 확장할 수는 없다.
  • Bonsai-8B의 19/20 정확도와 한 문제의 오답 원인은 직접 답변 모드와 추론 허용 설정에 따라 달라진다. 서비스 지연 시간을 줄이는 직접 답변 모드와 더 오래 걸리는 추론 모드 사이의 품질·지연 시간 절충이 남아 있다.

실용적 조언

  • Bonsai-8B를 저사양 ARM 환경에서 실행할 때는 nucleo와 llama.cpp fork를 같은 프롬프트와 코어 수로 반복 측정하고, decode와 prompt processing을 분리해 비교하는 편이 적절하다. 2코어 기준 180토큰 프롬프트의 첫 토큰 생성 시간은 약 42초였으므로, 실서비스에서는 직접 답변 모드로 지연 시간을 먼저 제한해야 한다. 다른 하드웨어에서 수치가 재현되지 않으면 저장소의 벤치마크 방법과 프롬프트를 확인한 뒤 이슈로 남길 수 있다.

섹션별 상세

작성자는 Oracle Always-Free 2코어 ARM 인스턴스에서 Bonsai-8B를 실행하는 nucleo와 llama.cpp fork를 동일한 프롬프트와 깨끗한 환경에서 비교했다. 2코어에서 nucleo는 decode 2.8 tok/s와 prompt processing 4.3 tok/s를 기록해 llama.cpp fork의 2.46 tok/s와 2.77 tok/s를 앞섰고, 4코어에서도 5.3 tok/s와 7.7 tok/s로 4.84 tok/s와 5.5 tok/s를 넘었다. 180토큰 프롬프트의 첫 토큰 생성 시간도 2코어 기준 약 42초로, 표준 fork의 약 66초보다 짧았다.
nucleo의 성능 차이는 모델을 2.125bpw 인터리브 형식으로 한 번 변환하고, NEON 커널에서 128개 가중치 블록을 정확한 int32로 누적하는 실행 경로에서 비롯된다. 단일 토큰 처리와 배치 처리 경로가 같은 방식으로 계산되므로 두 경로의 출력은 비트 단위로 동일하게 생성된다. 작성자는 ARM과 Apple Silicon에서 149개 테스트와 254,000개 assertion을 통과시켰으며, 라이브 데모와 저장소의 벤치마크 자료로 결과를 재현할 수 있게 했다.
정확도 시험에서는 온도 0과 직접 답변 모드로 산술, 영어 사실, 이탈리아어 사실을 포함한 새 시험 20문제 중 19문제를 맞혔다. 한 문제의 오답은 양자화 오류가 아니라 경계적인 지식 문제였고, 먼저 추론하도록 허용하면 같은 가중치가 정답을 냈다. 다만 2코어에서 추론 과정에 수 분이 걸리기 때문에 실제 서비스는 지연 시간을 줄이려고 직접 답변 모드를 사용한다.
작성자는 nucleo가 모든 환경에서 가장 빠른 삼항 모델 엔진이라고 주장하지 않는다. 1.7B 모델에서는 mainline llama.cpp의 TQ2_0 경로가 더 빠르고, M3 Apple Silicon에서는 llama.cpp가 크게 앞서며, dotprod·i8mm 커널과 타일형 prefill 경로가 nucleo의 다음 개선 대상이다. 따라서 이번 결과는 특정 무료 ARM 인스턴스에서의 우위이지 모든 CPU와 모델에 일반화되는 순위가 아니다.

용어 해설

삼항 모델(Ternary Model)
가중치를 -1, 0, +1 세 값으로만 제한하는 모델이다. 저장 공간과 정수 연산 부담을 줄이는 대신, 제한된 가중치 표현으로도 정확도를 유지하도록 학습된 구조가 필요하다.
가중치당 비트 수(Bits per Weight)
모델 가중치 하나를 저장하는 데 필요한 평균 비트 수다. Bonsai-8B는 2.125bpw 인터리브 형식으로 변환되어 헤드와 임베딩을 포함한 전체 모델이 2.2GB로 저장된다.
NEON 커널(NEON Kernel)
ARM 프로세서의 NEON SIMD 명령을 활용하는 저수준 연산 코드다. nucleo는 128개 가중치 블록을 정확한 int32로 누적해 CPU 추론의 핵심 행렬 연산을 처리한다.
인터리브 형식(Interleaved Format)
모델 가중치를 실행에 유리한 순서로 재배치해 저장하는 형식이다. nucleo는 모델을 한 번 2.125bpw 인터리브 형식으로 변환한 뒤, 이 표현을 사용해 추론한다.
직접 답변 모드(Direct-Answer Mode)
질문에 답하기 전에 긴 추론 과정을 수행하지 않고 바로 답을 생성하는 실행 설정이다. 2코어 환경에서는 추론에 수 분이 걸릴 수 있어 서비스 지연 시간을 줄이기 위해 사용된다.

언급된 도구

nucleo추천

Bonsai-8B를 CPU에서 실행하는 독립적인 추론 엔진으로, 2.125bpw 형식과 ARM NEON 커널을 사용한다.

llama.cpp중립

nucleo의 성능을 비교하기 위한 기준선이며, mainline에는 TQ2_0과 dotprod·i8mm 커널이 포함되어 있다.

Reame중립

Oracle Always-Free 2코어 ARM 인스턴스 같은 최소 하드웨어에서 서비스를 제공하도록 nucleo를 통합한 서버다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.