off-grid-ai/OGAM
TypeScript0 / 0
휴대폰과 Mac에서 GGUF LLM, 비전, 음성, 이미지 생성을 완전 로컬로 실행해 데이터가 장치를 벗어나지 않게 하는 올인원 온디바이스 AI 애플리케이션이다.
TL;DR
모바일과 Mac에서 GGUF 포맷 모델을 포함한 여러 LLM과 Stable Diffusion, Whisper 기반 음성 전사, 비전 모델을 네이티브로 실행해 텍스트 생성, 이미지 생성, 카메라 기반 질의응답을 모두 로컬에서 처리하는 애플리케이션이다. 장치의 CPU, OpenCL 기반 GPU, Hexagon NPU, Core ML 백엔드를 자동으로 탐지해 가능한 한 빠른 가속을 선택하며 텍스트 생성은 플래그십 기기에서 15-40 tok/s 범위의 처리 속도를 보인다. 문서는 MiniLM 임베딩과 SQLite 기반 검색으로 프로젝트 지식 베이스를 로컬에 유지하고 함수 호출형 도구를 통합해 검색 결과를 대화 흐름에 주입한다. 이러한 설계는 네트워크와 클라우드 의존을 제거해 개인정보 유출과 API 비용을 줄이는 대신 장치 메모리 제약과 일부 하드웨어 호환성 이슈를 감수하게 한다.
핵심 포인트
- 완전한 오프라인 실행을 기본으로 하며 모델 파일을 사용자가 직접 가져와 실행할 수 있어 데이터가 외부로 전송되지 않는다. 이 설계는 개인정보 보호와 네트워크 비용 절감이라는 실질적 이점을 제공하며 기업이나 개인 사용자가 민감한 데이터를 로컬에서 처리하도록 한다. 또한 앱 내 모델 매니저가 메모리 사용량과 상주 모델을 시각화해 사용자가 직접 메모리 정책을 제어할 수 있게 한다.
- 다중 하드웨어 백엔드 지원으로 CPU, OpenCL 기반 GPU, Hexagon NPU, Core ML을 상황에 맞게 활용해 동일 장치에서 가능한 최상의 성능을 끌어낸다. 각 백엔드는 지원 가능한 양자화 형식과 모델 구조에 따라 자동 선택되며 사용자가 수동으로 오버라이드할 수 있다. 이로 인해 동일한 앱으로 다양한 기기 세대에서 효율적 실행이 가능해진다.
- 프로젝트 기반의 온디바이스 지식 베이스와 툴 콜링을 결합해 문서 검색과 함수 호출을 로컬 대화 흐름에 통합한다. 문서 임베딩은 MiniLM으로 생성되어 SQLite에 저장되고 검색 도구는 코사인 유사도로 관련 문맥을 찾아 대화에 주입한다. 함수 호출은 자동 루프 방지 메커니즘을 갖추어 급격한 재귀 호출을 막는 안전 장치를 포함한다.
- 채팅과 텍스트 생성 기능을 로컬에서 제공하며 Qwen 3, Llama 3.2, Gemma 3, Phi-4 같은 GGUF 모델을 직접 불러와 스트리밍 응답을 처리한다. 이 기능은 장치에서 모델을 로드하고 토큰 단위 스트리밍을 통해 사용자 인터랙션을 실시간으로 전달하도록 설계됐다. 설정에서 CPU, GPU, NPU 중 가속 백엔드를 선택하거나 자동 탐지가 가능한 구조로 되어 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Text generation (CPU) | tok/s | 15-30 | — |
| Text generation (GPU / OpenCL) | tok/s | 20-40 | — |
| Image generation (NPU) | time(s) | 5-10s | — |
| Image generation (CPU) | time(s) | ~15s | — |
| Vision inference | time(s) | ~7s | — |
이미지 분석




2.9k
Stars
277
Forks
+204
Trending
0
조회수
2.9k watchers142 open issuesMIT License
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.