본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

off-grid-ai/OGAM

TypeScript0 / 0

휴대폰과 Mac에서 GGUF LLM, 비전, 음성, 이미지 생성을 완전 로컬로 실행해 데이터가 장치를 벗어나지 않게 하는 올인원 온디바이스 AI 애플리케이션이다.

TL;DR

모바일과 Mac에서 GGUF 포맷 모델을 포함한 여러 LLM과 Stable Diffusion, Whisper 기반 음성 전사, 비전 모델을 네이티브로 실행해 텍스트 생성, 이미지 생성, 카메라 기반 질의응답을 모두 로컬에서 처리하는 애플리케이션이다. 장치의 CPU, OpenCL 기반 GPU, Hexagon NPU, Core ML 백엔드를 자동으로 탐지해 가능한 한 빠른 가속을 선택하며 텍스트 생성은 플래그십 기기에서 15-40 tok/s 범위의 처리 속도를 보인다. 문서는 MiniLM 임베딩과 SQLite 기반 검색으로 프로젝트 지식 베이스를 로컬에 유지하고 함수 호출형 도구를 통합해 검색 결과를 대화 흐름에 주입한다. 이러한 설계는 네트워크와 클라우드 의존을 제거해 개인정보 유출과 API 비용을 줄이는 대신 장치 메모리 제약과 일부 하드웨어 호환성 이슈를 감수하게 한다.

핵심 포인트

  • 완전한 오프라인 실행을 기본으로 하며 모델 파일을 사용자가 직접 가져와 실행할 수 있어 데이터가 외부로 전송되지 않는다. 이 설계는 개인정보 보호와 네트워크 비용 절감이라는 실질적 이점을 제공하며 기업이나 개인 사용자가 민감한 데이터를 로컬에서 처리하도록 한다. 또한 앱 내 모델 매니저가 메모리 사용량과 상주 모델을 시각화해 사용자가 직접 메모리 정책을 제어할 수 있게 한다.
  • 다중 하드웨어 백엔드 지원으로 CPU, OpenCL 기반 GPU, Hexagon NPU, Core ML을 상황에 맞게 활용해 동일 장치에서 가능한 최상의 성능을 끌어낸다. 각 백엔드는 지원 가능한 양자화 형식과 모델 구조에 따라 자동 선택되며 사용자가 수동으로 오버라이드할 수 있다. 이로 인해 동일한 앱으로 다양한 기기 세대에서 효율적 실행이 가능해진다.
  • 프로젝트 기반의 온디바이스 지식 베이스와 툴 콜링을 결합해 문서 검색과 함수 호출을 로컬 대화 흐름에 통합한다. 문서 임베딩은 MiniLM으로 생성되어 SQLite에 저장되고 검색 도구는 코사인 유사도로 관련 문맥을 찾아 대화에 주입한다. 함수 호출은 자동 루프 방지 메커니즘을 갖추어 급격한 재귀 호출을 막는 안전 장치를 포함한다.
  • 채팅과 텍스트 생성 기능을 로컬에서 제공하며 Qwen 3, Llama 3.2, Gemma 3, Phi-4 같은 GGUF 모델을 직접 불러와 스트리밍 응답을 처리한다. 이 기능은 장치에서 모델을 로드하고 토큰 단위 스트리밍을 통해 사용자 인터랙션을 실시간으로 전달하도록 설계됐다. 설정에서 CPU, GPU, NPU 중 가속 백엔드를 선택하거나 자동 탐지가 가능한 구조로 되어 있다.

벤치마크

벤치마크지표비교
Text generation (CPU)tok/s15-30
Text generation (GPU / OpenCL)tok/s20-40
Image generation (NPU)time(s)5-10s
Image generation (CPU)time(s)~15s
Vision inferencetime(s)~7s

이미지 분석

앱의 온보딩 및 초기 인터페이스를 촬영한 화면 녹화 GIF로, 첫 실행 흐름과 기본 UI 구성 요소를 시각적으로 보여준다.
이 GIF는 앱이 처음 실행되었을 때 사용자에게 보이는 온보딩과 채팅 인터페이스의 주요 레이아웃을 시각적으로 전달한다. 화면 상단의 모델 선택 영역과 중앙의 'Start a Conversation' 상태, 하단의 입력창과 키보드 동작을 통해 대화 시작 흐름이 어떻게 진행되는지 확인할 수 있다. 또한 UI가 모바일 환경에 최적화되어 있음을 보여주며 모델 선택과 입력 인터랙션이 직관적으로 연결되는 구조임이 드러난다.
텍스트 생성 인터랙션을 보여주는 데모 GIF로, 입력에서 출력으로 스트리밍되는 응답과 키보드 및 전송 UI를 확인할 수 있다.
이 GIF는 모델이 입력에 대해 어떻게 응답을 스트리밍하는지를 화면 기록으로 보여줘 응답 지연과 렌더링 방식을 직관적으로 파악하게 한다. 입력창에 텍스트를 넣고 전송한 뒤 결과가 점진적으로 나타나는 장면은 스트리밍 출력 구현과 사용자 인터랙션의 즉시성을 확인하는 근거 자료가 된다. 또한 키보드 레이아웃과 전송 버튼의 존재로 모바일에서의 대화 경험 설계 방식을 유추할 수 있다.
앱 내 이미지 생성 기능의 사용 흐름을 보여주는 데모 GIF로, 프롬프트 입력과 생성된 이미지 미리보기를 순차적으로 보여준다.
이 GIF는 Stable Diffusion 기반 이미지 생성 UI가 프롬프트를 받아 실시간 미리보기를 제공하는 과정을 촬영해, 사용자 입력이 어떻게 이미지 생성 파이프라인으로 전달되는지 시각적 증거를 제공한다. 생성 중간 상태와 완료된 이미지를 비교해 생성 지연과 사용자 피드백 루프가 어떻게 구성되는지 알 수 있다. 또한 이미지 모델 선택과 생성 옵션 인터페이스가 모바일에 최적화되어 있음을 확인할 수 있다.
카메라 기반 비전 기능의 시연 GIF로, 실시간 장면 분석과 질문 응답을 통합한 사용자 흐름을 보여준다.
이 GIF는 카메라를 통해 입력된 장면을 모델이 처리해 설명을 생성하거나 객체를 식별하는 과정을 보여줘 비전 추론 성격과 인터랙션을 확인할 수 있다. 장면을 촬영하고 모델 응답이 텍스트로 출력되는 흐름은 비전 모델의 레이턴시와 결과 형식을 판단할 수 있는 근거가 된다. 또한 모바일 카메라 접근과 UI의 통합 방식이 어떻게 설계되었는지를 파악하게 해준다.

2.9k

Stars

277

Forks

+204

Trending

0

조회수

2.9k watchers142 open issuesMIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.