본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

FlashML-org/FreeToken

Python0 / 0

소비자용 NVIDIA GPU에서 대형 MoE 모델을 실행하는 Desktop·CLI serving engine

TL;DR

FreeToken은 NVIDIA RTX 30·40·50 시리즈 같은 소비자 하드웨어에서 대형 open-weight MoE 모델을 실행하는 Python 기반 standalone serving engine입니다. GPU·CPU·호스트 메모리를 함께 사용하고, expert cache·KV cache·double-buffered prefill·대역폭 적응형 실행으로 메모리와 추론 경로를 관리합니다. Desktop app과 CLI를 제공하며 Anthropic/OpenAI-compatible API로 coding agent와 tool-calling 애플리케이션에 연결할 수 있습니다. 로컬에서 DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2 같은 지원 모델을 RTX 장비로 운용하려는 개발자에게 적합하지만, README에는 NVIDIA 외 하드웨어 지원과 정량 벤치마크가 제시되어 있지 않습니다.

핵심 포인트

  • FreeToken은 Python 기반의 standalone MoE serving engine이며, 개인용 하드웨어에서 frontier-scale open-weight 모델을 실행하는 도구입니다. GPU·CPU·호스트 메모리·interconnect를 하나의 elastic inference platform으로 묶어 소비자 장비를 대상으로 합니다. NVIDIA RTX 30·40·50 시리즈를 사용하면서 대형 MoE 모델을 로컬에서 돌리려는 경우에 맞습니다.
  • CPU와 GPU가 함께 추론할 때 대역폭에 맞춰 q⋆ policy로 작업을 나누고, prefill streaming에는 full-layer double buffering을 사용합니다. global LRU expert caching과 graph-compatible execution으로 자주 쓰는 expert와 실행 경로를 재사용하며, FTW fast weight format도 제공합니다. README는 이러한 구조가 290B+ frontier MoE 모델을 개인용 gaming PC에서 interactive speed로 실행하도록 설계됐다고 밝힙니다.
  • Semantic anchor checkpoint가 recurrent state와 KV cache를 저장해 tool call이나 thinking block처럼 agent context를 편집할 때 중복 context recomputation을 줄입니다. 실행 중에는 engine 재시작이나 weight reload 없이 expert cache와 KV memory 사이의 VRAM 배분을 바꿀 수 있습니다. 긴 대화와 coding·tool-calling agent처럼 context 재계산과 메모리 배분이 반복되는 워크로드에 유용한 구조입니다.
  • Windows·Linux용 Desktop app은 설치와 engine 설정, 모델 실행, 채팅, 튜닝을 GUI로 묶고 CLI는 uv 또는 pip 설치를 제공합니다. DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2와 MXFP4·NVFP4·FP8·BF16 형식을 지원하며 Anthropic/OpenAI-compatible API로 Codex, Claude Code, OpenCode, OpenClaw, DeepSeek Harness와 연결할 수 있습니다. NVIDIA RTX 계열을 보유하고 GUI 또는 CLI 기반의 로컬 API 서버가 필요하다면 우선 검토할 만하지만, AMD·Apple GPU 지원은 README에 기재되어 있지 않습니다.

이미지 분석

FreeToken Desktop의 Console 화면에서 모델 실행 상태, 저장 비용, 처리 토큰 수, 요청 수, TTFT, KV cache와 MoE expert cache의 VRAM 설정을 한 화면에 관리합니다.
화면에는 DeepSeek-V4-Flash FP4 실행 상태와 tokens/s, requests, TTFT가 표시되고, KV cache size와 MoE expert cache를 슬라이더로 조정하는 구성이 보입니다. README가 말한 GUI 기반 모델 실행과 런타임 메모리 재배분 기능을 시각적으로 뒷받침하지만, 화면 수치 자체는 README의 공식 벤치마크로 제시되지 않았습니다.

5.2k

STARS

457

FORKS

+210

TRENDING

0

조회수

watchers 5.2kopen issues 138Apache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.