jjang-ai/mlxstudio
0 / 0
Apple Silicon에서 MLX 모델을 Chat·이미지·음성·OpenAI API로 통합 실행하는 macOS 앱
TL;DR
MLX Studio는 Apple Silicon용 MLX 기반 vMLX inference server를 감싼 native macOS 앱으로 Chat, Vision, Image Generation, TTS, STT를 한곳에서 실행합니다. Hugging Face 모델을 앱에서 내려받고 OpenAI-compatible HTTP API로 localhost에 노출하며, Electron UI와 번들 Python 3.12 환경 덕분에 별도 Python 설치가 필요하지 않습니다. Continuous Batching, PagedAttention, Speculative Decoding, KV Cache Quantization, Prefix Caching을 통해 로컬 메모리와 처리량을 관리하고 모델 변환·양자화·진단 도구도 제공합니다. macOS 14 이상과 Apple Silicon이 필수이며, 8GB RAM에서 실행할 수 있지만 대형 모델에는 16GB 이상과 모델별 1~50GB 디스크 공간이 필요합니다.
핵심 포인트
- MLX Studio는 Apple Silicon에서 vMLX inference server를 실행하는 standalone macOS 앱입니다. Electron UI와 번들 Python 3.12 환경을 함께 제공해 별도 Python 설정이나 터미널 작업 없이 모델을 내려받고 실행합니다. MLX 생태계에서 Chat, Vision, 이미지 생성, 음성 기능을 한 화면에 묶으려는 사용자에게 적합합니다.
- 앱은 Hugging Face에서 모델을 직접 선택한 뒤 localhost의 OpenAI-compatible HTTP API로 서비스를 노출합니다. Chat, Responses endpoint와 streaming, tool calling, structured output을 통해 일반 클라이언트나 agent workflow에서 연결할 수 있습니다. 다만 README와 화면에는 특정 모델 서버의 상태가 error로 표시된 사례도 있어 실제 모델별 호환성 확인이 필요합니다.
- vMLX 엔진은 Continuous Batching, PagedAttention, Speculative Decoding, KV Cache Quantization, Prefix Caching을 사용합니다. 요청을 배치 처리하고 캐시와 양자화를 적용해 Apple Silicon의 제한된 메모리에서 긴 문맥과 여러 요청을 처리하는 구조입니다. 8GB RAM부터 실행할 수 있지만 README는 대형 모델 사용에 16GB 이상을 권장하며 모델별 디스크 사용량은 1~50GB입니다.
- Chat과 Server 외에도 diffusion 기반 Image Generation, Kokoro TTS, Whisper STT, 모델 변환·양자화·진단 도구를 앱에 포함합니다. JANG mixed-precision quantization과 MLX Uniform 프로필을 선택해 Hugging Face 모델을 Apple Silicon용 형식으로 변환할 수 있습니다. 모델을 직접 관리하면서 GUI와 API를 함께 쓰려는 Mac 사용자에게 기능 범위가 넓습니다.
이미지 분석




944
Stars
65
Forks
+204
Trending
0
조회수
944 watchers12 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.