Osmantic/ODS
Python0 / 0
원커맨드 설치로 PC·Mac·Linux에서 로컬 AI 서버를 구성해 인퍼런스, 채팅 UI, 음성, 에이전트, 워크플로, RAG, 이미지 생성을 통합 운영할 수 있다.
TL;DR
ODS는 단일 호스트에서 완전한 로컬 AI 서버 스택을 빠르게 가동하도록 설계된 배포 시스템으로서 하드웨어 자동 탐지와 모델 카탈로그 매핑, 부트스트랩으로 즉시 채팅을 시작하는 흐름을 제공한다. 설치기는 GPU/통합 메모리를 판별해 적합한 GGUF 모델을 선택하고 1.5B 부트스트랩 모델로 빠르게 응답을 보장한 뒤 풀 모델을 백그라운드에서 내려받아 무중단으로 교체한다. 대시보드, Open WebUI 채팅, Hermes 에이전트, n8n 워크플로, Qdrant 기반 RAG, ComfyUI 기반 이미지 생성, Whisper/Kokoro 음성 등 다양한 서비스가 사전 연결된 상태로 제공되어 추가 구성 시간을 크게 단축하며 확장 시스템을 통해 커스텀 서비스를 플러그인처럼 추가할 수 있다. 다만 운영자는 멀티 GPU나 대용량 모델 운용을 위해 적절한 VRAM과 디스크를 준비하고 설치기 권장 플랫폼 지원 표를 확인해야 한다.
핵심 포인트
- 하드웨어 자동 탐지와 모델 카탈로그 매핑을 통합해 NVIDIA, AMD Strix Halo, Apple Silicon, Intel Arc 등 플랫폼별로 최적화된 GGUF 선택을 수행한다. 이 매핑은 설치기 내부의 select-model.py 또는 PowerShell 티어 맵을 통해 결정되어 .env에 선택 결과를 기록한다. 결과적으로 사용자는 카드별로 모델 적합성을 수동으로 판단하지 않아도 된다.
- 부트스트랩 모드를 기본으로 채택해 소형 모델로 빠른 첫 응답을 보장하면서 풀 모델을 비차단으로 다운로드해 서비스 가용성을 유지한다. 설치기가 1.5B 모델을 단시간에 설치하고 이후 백그라운드 전환을 수행하므로 초기 체감 시간이 크게 단축된다. 이 접근은 긴 모델 다운로드 때문에 설치를 중단하던 경험을 근본적으로 줄인다.
- 확장성 관점에서 모든 서비스가 manifest.yaml/compose.yaml 기반의 플러그인으로 설계되어 사용자 정의 서비스 추가와 핫플러그가 가능하다. ods CLI의 enable/disable 명령으로 확장 토글이 가능하며 설치 스택은 Compose 조각을 자동 병합해 충돌을 최소화한다. 이 구조는 포크와 맞춤형 배포를 용이하게 해 운영자별 커스터마이징을 지원한다.
- 로컬 모델 추론을 자동 구성하고 하드웨어에 맞는 GGUF 모델을 선택해 .env에 모델 변수와 컨텍스트 한계를 기록한다. 설치기는 GPU와 통합 메모리 특성을 감지해 모델 카탈로그에서 적합한 바이너리를 선택하며 필요 시 사용자가 프로파일을 강제할 수 있다. 이 과정은 설치 단계와 런타임 스택에서 자동으로 반영되어 모델 교체와 롤백이 가능하도록 설계되어 있다.
이미지 분석

4k
Stars
595
Forks
+206
Trending
0
조회수
4k watchers403 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.