모바일과 엣지 기기에서 Gemma 3를 가장 빠르고 효율적으로 실행
LLM Framework·C++3 / 0
모바일, 데스크톱, 임베디드 기기에서 LLM을 CPU/GPU/NPU 가속을 통해 고성능으로 실행하는 구글의 공식 추론 프레임워크입니다.
주요 기능
- CPU, GPU 및 NPU(Qualcomm/MediaTek) 하드웨어 가속 지원
- Gemma 3, Phi-4, Qwen 2.5 등 주요 오픈 모델 최적화 배포
- 멀티모달(시각, 음성) 입력 및 함수 호출(Function Calling) 기능 제공
- Kotlin, C++, Swift 등 다양한 언어 바인딩 및 SDK 지원
- CLI 도구 'lit'을 통한 간편한 모델 관리 및 로컬 테스트
사용 사례
- 인터넷 연결 없이 모바일 앱 내에서 개인화된 AI 챗봇 구현
- 엣지 디바이스에서 실시간 이미지 분석 및 텍스트 생성 파이프라인 구축
- 저지연이 필요한 데스크톱 앱에 경량 LLM 기능을 직접 통합
2k
Stars
209
Forks
+642
Trending
3
조회수
2k watchers120 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.