FlashML-org/FreeToken
Python0 / 0
소비자용 NVIDIA GPU에서 대형 MoE 모델을 실행하는 Desktop·CLI serving engine
TL;DR
FreeToken은 NVIDIA RTX 30·40·50 시리즈 같은 소비자 하드웨어에서 대형 open-weight MoE 모델을 실행하는 Python 기반 standalone serving engine입니다. GPU·CPU·호스트 메모리를 함께 사용하고, expert cache·KV cache·double-buffered prefill·대역폭 적응형 실행으로 메모리와 추론 경로를 관리합니다. Desktop app과 CLI를 제공하며 Anthropic/OpenAI-compatible API로 coding agent와 tool-calling 애플리케이션에 연결할 수 있습니다. 로컬에서 DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2 같은 지원 모델을 RTX 장비로 운용하려는 개발자에게 적합하지만, README에는 NVIDIA 외 하드웨어 지원과 정량 벤치마크가 제시되어 있지 않습니다.
핵심 포인트
- FreeToken은 Python 기반의 standalone MoE serving engine이며, 개인용 하드웨어에서 frontier-scale open-weight 모델을 실행하는 도구입니다. GPU·CPU·호스트 메모리·interconnect를 하나의 elastic inference platform으로 묶어 소비자 장비를 대상으로 합니다. NVIDIA RTX 30·40·50 시리즈를 사용하면서 대형 MoE 모델을 로컬에서 돌리려는 경우에 맞습니다.
- CPU와 GPU가 함께 추론할 때 대역폭에 맞춰 q⋆ policy로 작업을 나누고, prefill streaming에는 full-layer double buffering을 사용합니다. global LRU expert caching과 graph-compatible execution으로 자주 쓰는 expert와 실행 경로를 재사용하며, FTW fast weight format도 제공합니다. README는 이러한 구조가 290B+ frontier MoE 모델을 개인용 gaming PC에서 interactive speed로 실행하도록 설계됐다고 밝힙니다.
- Semantic anchor checkpoint가 recurrent state와 KV cache를 저장해 tool call이나 thinking block처럼 agent context를 편집할 때 중복 context recomputation을 줄입니다. 실행 중에는 engine 재시작이나 weight reload 없이 expert cache와 KV memory 사이의 VRAM 배분을 바꿀 수 있습니다. 긴 대화와 coding·tool-calling agent처럼 context 재계산과 메모리 배분이 반복되는 워크로드에 유용한 구조입니다.
- Windows·Linux용 Desktop app은 설치와 engine 설정, 모델 실행, 채팅, 튜닝을 GUI로 묶고 CLI는 uv 또는 pip 설치를 제공합니다. DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2와 MXFP4·NVFP4·FP8·BF16 형식을 지원하며 Anthropic/OpenAI-compatible API로 Codex, Claude Code, OpenCode, OpenClaw, DeepSeek Harness와 연결할 수 있습니다. NVIDIA RTX 계열을 보유하고 GUI 또는 CLI 기반의 로컬 API 서버가 필요하다면 우선 검토할 만하지만, AMD·Apple GPU 지원은 README에 기재되어 있지 않습니다.
이미지 분석

5.2k
STARS
457
FORKS
+210
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.