TL;DR
작성자는 mnn, Google AI Studio, llama.CPP를 통합한 오픈소스 모바일 AI 앱을 공개하고 동일 기기에서 Gemma 3 1B(gguf+llama.CPP)로는 약 20 token/s, Gemma 4 e2b(TFLite)로는 약 10 token/s의 처리량을 보고했다. 앱은 음성 입출력·RAG·OCR과 자체 호스팅 서버, 웹 인터페이스를 지원하도록 설계되었으며 'Invent' 기능에서는 Planner→Researcher→Coder로 이어지는 모델 체이닝을 통해 프로젝트 생성과 코드 출력을 목표로 한다. 메모리 제약을 완화하기 위해 작성자는 zcp(zero copy protocol)라 부르는 순차 로드·컨텍스트 압축 방식을 제안했으며 이 방식은 메모리 사용을 줄이는 대가로 처리 지연이 발생한다고 명시되었다.
실용적 조언
- 작성자는 모바일에서 모델을 직접 실행할 때 런타임 선택과 모델 형식이 처리량에 큰 영향을 미친다는 점을 경험적으로 제시했다. Gemma 3을 GGUF/llama.CPP로 실행했을 때와 Gemma 4를 TFLite로 실행했을 때의 token/sec 차이를 근거로 삼으면서, 모바일 성능 최적화에서는 런타임과 포맷을 실기기에서 검증할 필요가 있다고 권했다. 또한 zcp 같은 모델 순차 로딩 방식은 메모리 제약을 완화하지만 처리 지연을 수반하므로 성능·응답성의 트레이드오프를 고려해야 한다.
섹션별 상세
용어 해설
- GGUF
- — GGUF는 모델을 저장하는 바이너리 포맷으로, 경량 런타임에서 모델 파일을 로드하는 용도로 쓰인다. 작성자는 GGUF 형식 모델을 llama.CPP로 실행해 모바일에서 성능을 측정했다고 보고했다.
- TensorFlow Lite(TFLite)
- — TFLite는 모바일·임베디드 환경에서 추론을 수행하도록 최적화된 TensorFlow의 런타임과 모델 변환 규격이다. 게시물에서는 Gemma 4 e2b를 TFLite로 실행한 결과를 모바일 성능 비교에 사용했다.
- 검색 증강 생성(RAG)
- — RAG는 외부 문서 검색 결과를 모델 입력에 주입해 응답 정확도를 높이는 방식으로, 검색 단계와 모델 응답 생성 단계를 결합한다. 게시물에 따르면 앱에 RAG 기능이 포함되어 있어 외부 지식을 컨텍스트로 활용한다고 밝혔다.
- 제로 카피 프로토콜(Zero Copy Protocol (zcp))
- — zcp는 게시물 작성자가 제안한 모델 간 통신 및 컨텍스트 관리 방식으로, 모델을 순차적으로 로드·언로드하면서 컨텍스트를 압축·집약하여 메모리 사용을 줄인다고 주장됐다. 구현 세부는 공개되지 않은 상태이다.
언급된 도구
모델을 로컬에서 실행하는 경량 추론 런타임
모바일·임베디드 환경용 모델 런타임
작성자가 통합한 외부 AI 서비스·도구군
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.