Mac 메뉴바에서 관리하는 SSD 캐싱 기반 고성능 로컬 LLM 서버
AI Tool·Python1 / 0
Apple Silicon Mac에서 SSD 계층형 캐싱과 연속 배칭을 통해 대규모 컨텍스트 LLM을 효율적으로 구동하는 추론 서버이다.
주요 기능
- Homebrew를 통해 설치하고 백그라운드 서비스로 등록하여 시스템 시작 시 자동 실행한다.
- 메모리가 가득 차면 KV 캐시 블록을 SSD로 오프로딩하고, 동일한 접두사 요청 시 재계산 없이 즉시 복구한다.
- LLM, VLM, 임베딩, 리랭커 등 다양한 유형의 모델을 동시에 서빙하며 LRU 기반으로 메모리를 자동 관리한다.
- 웹 기반 어드민 패널에서 실시간 추론 통계 확인, 모델 다운로드, 1클릭 벤치마크를 수행한다.
사용 사례
- Claude Code와 연동하여 로컬 환경에서 보안 걱정 없이 대규모 프로젝트의 코드를 분석하고 수정할 때
- 통합 메모리가 부족한 Mac 환경에서 SSD 캐싱을 활용해 70B 이상의 대형 모델을 안정적으로 구동할 때
13.6k
Stars
1.2k
Forks
+563
Trending
1
조회수
13.6k watchers336 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.