FermionResearch/Neutrino-8B
모든 트랜스포머 선형을 5값 서브-2비트로 패킹해 8B 모델을 3.9GB 컨테이너 하나로 배포한 초압축 양자화.
학습 방식 · Qwen3-8B를 기반으로 ternary QAT(양자화 인지 학습)를 적용하고 Fermion Research가 단계적 post-training을 수행했다. 드래프트 전용 자매 모델(Neutrino-0.6B)은 이 8B의 롤아웃을 증류해 별도로 만들었다.
TL;DR
Neutrino-8B는 Qwen3-8B를 ternary QAT와 단계적 post-training으로 재학습해 모든 트랜스포머 선형(252개)을 5값 서브-2비트로 패킹, int8 임베딩과 함께 3,875,404,812바이트 단일 TRTC v4 컨테이너에 담은 8B 대화 모델이다. GSM8K flexible-extract 51.00, stated-format 49.33을 기록해 같은 바이트 클래스의 Ternary-Bonsai-8B(각각 35.0, 39.67)를 앞섰지만, IFEval prompt-strict(73.17 vs 83.65)와 BFCL v3(65.31 vs 71.45)에서는 오히려 뒤처져 지표별로 우열이 나뉜다. pip 설치형 참조 경로, 자체 llama.cpp 포크의 GGUF(FV5 텐서), Apple MLX, 그리고 클로즈드소스 네이티브 바이너리까지 네 가지 실행 경로를 제공하며 하드웨어별 실측 속도(L4 35.4tok/s, M5 25tok/s 등)를 공개했다. 자매 모델 Neutrino-0.6B를 드래프트로 붙이면 Linux x86-64 CPU에서 2.23배 빨라지고, 그리디 디코딩에서는 결과 토큰까지 동일하게 유지된다.
핵심 포인트
- 모든 트랜스포머 선형을 5값(서브-2비트)으로 패킹해 디코드 경로에 fp16·fp32 가중치를 전혀 남기지 않았다.
- GSM8K에서는 동급 Ternary-Bonsai-8B를 앞섰지만(51.00 vs 35.0) IFEval·BFCL v3에서는 뒤처져 지표별로 갈린다.
- pip·GGUF(자체 포크)·MLX·클로즈드소스 네이티브 바이너리 네 가지 실행 경로를 제공하며 각 경로의 실측 토큰/초·메모리 수치를 투명하게 공개했다.
- 자매 모델 Neutrino-0.6B를 드래프트로 쓰면 Linux x86-64 CPU에서 2.23배 빨라지고 그리디 출력은 동일하다.
제한사항
- IFEval prompt-strict(73.17)와 BFCL v3(65.31)는 같은 바이트 클래스의 Ternary-Bonsai-8B(83.65, 71.45)보다 낮아, 지시 이행과 도구 호출 정밀도에서는 경쟁 모델에 못 미친다.
- CUDA용 네이티브 바이너리는 아직 제공되지 않아 CUDA에서는 pip torch 경로로 폴백해야 하고, 저자 실측으로 그 경로에는 드래프트 사용 시 속도 이득이 없다(L4에서 0.99배).
- GGUF 경로는 자체 llama.cpp 포크에서만 로드되고 stock llama.cpp·Ollama·LM Studio는 아직 FV5 텐서 타입을 지원하지 않아 범용 GGUF 생태계와는 호환되지 않는다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GSM8K flexible-extract | accuracy (0-shot greedy) | 51.00 | Ternary-Bonsai-8B 35.00 (동일 하니스) |
| GSM8K stated-format | accuracy | 49.33 | Ternary-Bonsai-8B 39.67 (동일 하니스) |
| IFEval prompt-strict | score | 73.17 | Ternary-Bonsai-8B 83.65 (동일 하니스, 저쪽이 더 높음) |
| BFCL v3 | macro (13-subset) | 65.31 | Ternary-Bonsai-8B 71.45 (동일 하니스, 저쪽이 더 높음) |
| MMLU-Redux | accuracy | 67.84 | Ternary-Bonsai-8B 71.47 (동일 하니스, 저쪽이 더 높음) |
63
LIKES
6.3k
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.