antirez/ds4
C6 / 0
Metal/CUDA/ROCm용 DeepSeek V4 Flash 전용 고성능 로컬 추론 런타임
TL;DR
DwarfStar는 DeepSeek V4 Flash를 1차 목표로 삼는 경량 로컬 추론 엔진으로, Metal을 주력으로 CUDA와 ROCm을 지원하고 SSD 스트리밍, 파이프라인 병렬, tensor parallelism으로 메모리 제약을 우회합니다. 일반 GGUF 런너가 되기를 포기한 대신 모델 로딩·프롬프트 렌더링·툴 호출·KV 상태·HTTP 서버·코딩 에이전트를 한 트리에서 함께 빌드하고 테스트하며, 받아들이는 파일은 DeepSeek V4와 GLM 5.2의 특정 GGUF 레이아웃뿐입니다. 2비트 양자화는 routed MoE 전문가만 IQ2_XXS와 Q2_K로 낮추고 공유 전문가·프로젝션·라우팅은 그대로 두며, imatrix 버전을 권장합니다. 고메모리 MacBook, DGX Spark, Strix Halo 같은 소비자 하드웨어에서 큰 모델을 돌리는 데 맞지만 소프트웨어는 빠르게 변하는 베타 품질이라고 밝힙니다.
핵심 포인트
- 모델 로딩·프롬프트 렌더링·툴 호출·KV 상태·HTTP 서버·코딩 에이전트를 한 트리에서 함께 빌드·테스트하는 통합 구조입니다.
- Metal(96GB 이상 Mac)을 주력으로 NVIDIA CUDA 멀티-GPU·DGX Spark와 Strix Halo ROCm을 공식 지원합니다.
- 메모리가 부족하면 SSD 스트리밍으로 routed 전문가를 캐시하고, 파이프라인·텐서 병렬로 여러 기기의 RAM을 합칩니다.
- 지원 GGUF는 DeepSeek V4와 GLM 5.2의 특정 레이아웃뿐이고, 2비트 양자화는 routed MoE 전문가만 대상으로 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MacBook Pro M3 Max (128 GB) q2 short | generation t/s | 26.68 | — |
| Mac Studio M3 Ultra (512 GB) q4 long | prefill t/s | 448.82 | — |
| DGX Spark GB10 (128 GB) q2 7047 tokens | prefill t/s | 343.81 | — |
이미지 분석
20.6k
STARS
1.8k
FORKS
+204
TRENDING
6
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.