5값(서브-2비트)으로 패킹한 8B 대화 모델
Qwen3-8B 기반의 five-valued(서브-2비트) ternary 양자화 8B 모델로, 트랜스포머 선형을 패킹해 단일 TRTC v4 컨테이너로 배포합니다.
TL;DR
Neutrino-8B는 Qwen3-8B를 기반으로 Fermion Research가 ternary QAT와 단계적 포스트 트레이닝을 적용해 만든 8B 대화형 텍스트 생성 모델로, 모든 트랜스포머 선형을 five-valued 서브-2비트로 패킹해 단일 TRTC v4 컨테이너에 담아 배포합니다. 런타임 측면에서는 pip·GGUF(전용 llama.cpp 포크)·MLX·네이티브 바이너리 등 여러 실행 표면을 제공하며 각 경로별 속도와 메모리 수치가 README에 실측값으로 명시되어 있습니다. 벤치마크에서는 GSM8K flexible 51.00, IFEval prompt-strict 73.17, MMLU-Redux 67.84 등을 기록했고 Neutrino-0.6B 드래프트와의 speculative decoding을 통해 환경에 따라 최대 ×2.23의 처리량 향상을 얻을 수 있습니다.
핵심 역량
- 5값(서브-2비트) 테너리 가중치를 사용해 8,190,735,360 파라미터치 모델을 3.875 GB 컨테이너로 배포합니다. 디스크와 전송 비용을 낮추기 위해 모든 트랜스포머 선형이 bit-packed된 형식으로 들어가며 런타임에서 스케일을 그리드에 스냅해 복원합니다. 이 설계는 제한된 메모리 환경에서도 모델을 불러올 수 있게 합니다.
- 최대 컨텍스트 길이는 40,960 토큰으로 설계되어 장문 대화나 긴 문맥을 다루는 작업에 적합합니다. KV 캐시는 토큰당 144 KiB(fp16)를 소비하며 4k/32k 길이에서 각각 약 0.60 GB와 4.83 GB의 메모리를 요구합니다. 긴 컨텍스트 작업에서 메모리 예산 산정이 명확하게 제공되어 실무 배치 계획에 도움을 줍니다.
- 여러 실행 표면을 지원하며 reference 'pip' 경로와 GGUF/llama.cpp 포크, MLX(Apple Metal)와 자체 바이너리(bin/) 같은 다양한 런타임을 제공합니다. 각 경로별로 속도와 메모리 지표가 공개되어 있어 환경에 따라 합리적인 선택을 할 수 있습니다. 특히 L4 CUDA 전개와 Apple M5, 네이티브 바이너리에서의 실측 토크 속도가 레포에 수록되어 있습니다.
- Neutrino-0.6B와 짝지어 쓰는 speculative decoding(추측적 디코딩)을 공식 지원해 적절한 조합에서 실사용 처리량을 유의미하게 올릴 수 있습니다. 그리디 모드에서는 드래프트-타깃 일치가 인증되어 텍스트 동일성이 보장됩니다. 실험 결과에 따라 클래스별 agreement와 end-to-end speedup 표가 제공되어 예상 성능을 예측하기 쉽습니다.
강점
- 디스크 점유가 매우 작아 네트워크 전송과 로컬 저장 비용을 줄이는 것이 큰 장점입니다. 8B급 모델을 five-valued 패킹으로 3,875,404,812 바이트 컨테이너에 담아 배포하며 TV4Z 전송 포맷은 66.05% 용량으로 추가 제공됩니다. 이로 인해 제한된 환경에서도 비교적 빠르게 모델을 내려받아 실행할 수 있습니다.
- 런타임 및 배포 표면이 다양하게 준비되어 있어 CPU 전용, CUDA 오프로드, Apple Metal 등 환경별 최적 경로를 선택할 수 있습니다. 각 경로별 실측 토큰/초와 메모리 데이터가 공개되어 실제 배포 시 리소스 계획을 세우기 쉽습니다. 특히 L4에서의 35.4 tok/s, Apple M5 환경에서 25.0 tok/s 등 구체적 수치가 제공됩니다.
- 추측적 디코딩을 공식적으로 지원해 처리량을 높일 수 있는 전용 생태계를 갖추고 있습니다. Neutrino-0.6B와 페어링 시 H100에서 최대 ×2.23의 속도 향상을 관측했고 드래프트-타깃 일치성은 수만 개 토큰 단위로 인증되어 있습니다. 그리디 모드에서는 텍스트 동일성이 보장되므로 배치형 처리량 개선에 안전하게 적용할 수 있습니다.
훈련 방식
본 모델은 Qwen3-8B를 출발점으로 ternary QAT(quantization-aware training)을 적용하고 Fermion Research가 단계적 post-training을 수행한 결과물입니다. README는 트레이닝의 구체적 하이퍼파라미터를 공개하지 않지만 'ternary QAT + staged post-training'이라는 계보와 provenance를 명시해 출처를 추적할 수 있게 하고 있습니다. 드래프트 모델(Neutrino-0.6B)은 이 8B의 롤아웃을 증류해 추측적 디코딩 전용으로 별도 제작되었습니다.
알아두면 좋은 것
- 모델은 Qwen/Qwen3-8B를 기반으로 Fermion Research가 ternary QAT와 단계적 post-training을 거쳐 만든 배포판입니다. 모든 트랜스포머 선형은 'five-valued'로 패킹되어 단일 TRTC v4 컨테이너(neutrino-8b_v4.bin)에 저장되며 컨테이너 크기는 3,875,404,812 바이트입니다. README는 컨테이너 무결성(sha256)과 gguf/TV4Z 등 변환 산출물의 바이트 일치 검증을 포함한 프로비넌스(receipts)를 제공합니다.
- 레포는 세 가지 배포 표면을 명확히 구분합니다: pip 기반 fermion 런타임(참고 경로), GGUF+llama.cpp 포크(특수 FV5 텐서 타입), 그리고 MLX(Apple Metal) 패스입니다. 각 표면에서 실측 토크/초와 메모리 소모가 제시되어 운영 환경에 따른 선택 근거를 제공합니다. GGUF 경로는 해당 포크가 필요하다는 주의가 명시되어 있어 호환성 작업이 필요합니다.
- 생성 설정은 연구 허니스와 재현성을 위해 기본적으로 그리디(temperature 0, repetition penalty off)로 고정되어 있으며 README는 대화·구조화·긴문장 용도별 추천 설정과 측정 근거를 제공합니다. 그리디 모드에서의 동일성(토큰 단위)은 일부 경로에서 인증되어 허니스 재현성을 우선시한 실험 관행을 따릅니다. 샘플링 경로의 동작 범위와 장단점도 장치별로 분리하여 기술되어 있습니다.
- Neutrino-8B는 공개된 벤치마크에서 특정 태스크에 대해 경쟁력 있는 수치를 보이며, 특히 GSM8K flexible에서 51.00, GSM8K stated-format에서 49.33을 기록했습니다. 같은 바이트 클래스의 비교 모델(Ternary-Bonsai-8B)과의 same-harness 비교 행도 제공되어 상대 성능을 판단할 수 있습니다. 또한 IFEval, MMLU-Redux, BFCL v3 같은 종합 벤치 결과와 그 측정 프로토콜을 함께 제시합니다.
기술적 특징
- 모든 트랜스포머 선형은 'five-valued'로 저장되어 총 252개의 packed trit linears와 int8 임베딩 레인으로 구성됩니다. README의 바이트 예산은 ternary 레인이 전체 컨테이너의 67.2%를 차지하고 untied int8 임베딩이 32.1%를 차지한다고 명시합니다. 런타임에서는 스케일을 스냅(snap)해 복원하고 디코드 경로에는 fp16/fp32 가중치가 존재하지 않습니다.
- 아키텍처 지오메트리는 36개 디코더 레이어, 히든 4096, FFN 12,288(SwiGLU), grouped-query attention 4:1(쿼리 헤드 32, KV 헤드 8, head_dim 128), rotary_dims 128, max_pos 40,960 등 구체적 수치가 헤더에 기록되어 있습니다. KV 캐시는 토큰당 144 KiB(fp16)로 계산되어 4k/32k 문맥에서 각각 약 0.60 GB와 4.83 GB를 차지합니다. 이러한 세부 수치는 메모리 예산과 하드웨어 적합성 판단에 직접적으로 활용됩니다.
- 컨테이너-레벨 무결성과 변환 영수증을 통해 빌드→포장→변환 과정의 바이트 일치를 검증합니다. gguf 변환과 FV5 텐서 타입의 호환성, tv4z의 무손실 복원 등은 변환 파이프라인에서의 신뢰성을 뒷받침하며 README에 수록된 sha256과 receipts 파일들이 그 증거 역할을 합니다. 이 체계는 연구 허니스 재현성과 운영적 검증을 동시에 만족시키는 설계입니다.
차별점
- five-valued(서브-2비트) 테너리 패킹으로 8B급 모델을 2.56 GB 컨테이너(트랜스포트 코덱 기준) 또는 3.875 GB 원시 컨테이너에 담아 배포하는 점이 핵심 차별화입니다. 이 저장 형식은 전통적 fp16·int8 패킹과 다른 런타임-연동 복원 방식을 사용해 디스크 효율을 크게 높입니다. 결과적으로 메모리·대역폭 제약이 있는 환경에서 더 작은 배포 페이로드로 실사용이 가능해집니다.
- 런타임 생태계가 '단일 다운로드 후 즉시 사용'을 목표로 설계되어 pip 기반 fermion 패스와 바이너리 fast-path를 제공합니다. AutoModel을 통한 from_pretrained 한 줄 로드도 가능하지만 반드시 'import fermion'를 먼저 호출해야 trtc_v4가 등록되므로 사용 흐름이 명확하게 규정되어 있습니다. 또한 GGUF 경로와 MLX 경로 등 각 표면이 성능과 호환성 측면에서 서로 다른 장단점을 가집니다.
- 추측적 디코딩을 위한 공식 드래프트(Neutrino-0.6B)와의 통합은 실전 처리량 개선을 목표로 설계되어, H100에서의 측정된 가속과 클래스별 agreement 표가 함께 제공됩니다. 드래프트는 이 8B의 롤아웃을 증류해 만들었고, 그리디 모드에서는 드래프트+검증이 출력 동일성을 보장한다고 영수증으로 증명되어 있습니다. 이로 인해 스루풋 향상과 정확성 보증을 동시에 얻을 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Redux | accuracy | 67.84 | — |
| IFEval (prompt-strict) | score | 73.17 | — |
| BFCL v3 | macro | 65.31 | — |
| GSM8K (flexible-extract, 0-shot generative, greedy, 256 cap) | accuracy | 51.00 | Ternary-Bonsai-8B: 35.0 (same-harness) |
| GSM8K (stated-format, greedy, 1024 cap) | accuracy | 49.33 | Ternary-Bonsai-8B: 39.67 (same-harness) |
61
Likes
4.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.