본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ferrumox/rabbit

Rust0 / 0

디스크 스트리밍으로 50GB RAM에서 2.4T MoE를 실행하는 Rust CLI 엔진

TL;DR

rabbit은 50GB급 RAM을 가진 소비자용 CPU 머신에서 수조 파라미터 MoE를 실행하는 standalone Rust CLI 도구이자 연구용 inference engine입니다. 모델의 dense 부분은 양자화해 RAM에 상주시키고, routed expert는 1.26 TB 규모의 디스크 파일에서 필요한 토큰마다 NVMe 스트리밍으로 가져옵니다. Qwen3.8-Max 실행 시 실제 측정값은 45.7GB RAM과 4.71초/token이며, OpenAI-compatible HTTP 서버·다중 턴 session·여러 quantization 경로도 제공합니다. 다만 GPU와 ARM NEON을 지원하지 않고, expert I/O가 전체 decode 시간의 59%를 차지하므로 빠른 일반 목적 LLM 서버보다 대형 모델의 저메모리 CPU 추론 실험에 적합합니다.

핵심 포인트

  • 이 레포지토리는 GPU·BLAS·외부 추론 프레임워크 없이 대형 MoE를 실행하는 Rust 기반 CLI 연구 엔진입니다. Dense 파라미터는 RAM에 두고 routed expert를 디스크에서 토큰마다 읽습니다. 일반적인 local-LLM 서버보다 메모리에 들어가지 않는 모델 실험에 초점을 둡니다.
  • Qwen3.8-Max의 1.37 TB checkpoint에서 24.3 GB의 dense 부분과 expert cache를 RAM에 유지합니다. 필요한 expert만 per-layer LRU cache와 persistent usage cache를 거쳐 NVMe에서 스트리밍합니다. 두 NVMe로 checkpoint를 나누면 읽기 작업이 61%와 39%로 분산됩니다.
  • io_uring 기반 batched expert streaming은 각 expert의 바이트가 도착하는 즉시 matmul을 시작합니다. AVX2·AVX-512/VNNI kernel과 rayon으로 CPU 병렬 처리를 수행합니다. Slimbook ONE에서 Qwen3.8-Max는 45.7 GB RAM과 4.71초/token을 기록했습니다.
  • Qwen 3.8, Kimi K3, Kimi Linear 48B, GLM-5.2의 forward pass와 tokenizer·chat template를 reference code와 비교합니다. CLI의 --prompt·--chat·--serve·--session 인터페이스는 네 architecture에서 동일하게 작동합니다. GPU, ARM NEON, speculative decoding, grammar-constrained decoding, web UI는 아직 지원하지 않습니다.

벤치마크

벤치마크지표비교
Qwen3.8-Maxdecode4.71 s/token, 0.212 tok/s
Qwen3.8-MaxRAM used45.7 GB
Kimi K3decode5.93 s/token, 0.169 tok/srabbit v0.28.1 기준이며 v0.23.0보다 7.3배 빠름
GLM-5.2decode1.02 words/srabbit v0.22.0 기준이며 v0.14.0보다 3.5배 빠름

163

Stars

18

Forks

+204

Trending

0

조회수

163 watchers3 open issuesApache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.