Ollama보다 4배 빠른 Apple Silicon 전용 로컬 AI 엔진
Infrastructure·Python0 / 0
Apple Silicon의 통합 메모리와 Metal 커널을 활용하여 로컬 환경에서 초고속 추론과 도구 호출을 지원하는 OpenAI 호환 추론 엔진이다.
주요 기능
- Ollama 대비 최대 4.2배 빠른 추론 속도 제공
- 프롬프트 캐싱 및 DeltaNet 상태 스냅샷으로 0.08초 수준의 TTFT 달성
- 17가지 파서를 통한 100% 성공률의 도구 호출 및 자동 복구 수행
- 로컬 처리 한계 초과 시 클라우드 모델로 자동 전환하는 스마트 라우팅 실행
- Vision, Audio, Embedding 등 멀티모달 엔드포인트 통합 운영
어떻게 동작하는가
Apple의 MLX 프레임워크를 사용하여 통합 메모리 아키텍처에 최적화된 Metal 커널을 호출하며, 하이브리드 RNN 구조인 Qwen3.5를 위해 상태 스냅샷 방식의 프롬프트 캐싱을 구현하여 재계산 없이 문맥을 복원한다. 또한 양자화된 모델에서 발생하는 비정형 도구 호출 출력을 실시간으로 감지하고 구조화된 데이터로 재변환하는 복구 메커니즘을 갖추고 있다.
1.5k
Stars
207
Forks
+497
Trending
0
조회수
1.5k watchers40 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.