TL;DR
작성자는 Gemma 3 1B를 스마트폰에서 직접 실행해 네트워크 없이 Android 화면을 읽고 30개 도구를 호출하는 자율 에이전트를 구현했습니다. 배터리 확인이나 손전등 전환처럼 단순한 명령은 1B 모델이 처리하고, 복잡한 작업만 70B 클라우드 모델로 넘기며 라우팅 자체는 별도의 모델 호출 없이 결정론적으로 수행합니다. 모든 도구 호출은 매니페스트를 확인하는 정책 게이트를 거치고, 검증되지 않은 동작은 차단한 뒤 운영자 탭을 요구합니다. 134개 단위 테스트와 8개 기기 회귀 테스트, 약 8.7MB의 Release APK, 20개 화면에 걸친 Amazon 상품·가격 묶음 추출이 구현 근거로 제시됐지만, 낯선 앱에서의 단계 효율과 음성 인식 범위는 아직 제한적입니다.
실용적 조언
- 단순하고 반복적인 기기 명령은 온디바이스 소형 모델에 배정하고 복잡한 작업만 클라우드 모델로 넘기되, 라우팅 기준은 별도 모델 호출 없이 결정론적으로 고정하는 방식이 적합합니다.
- 도구 호출은 실행 후 감사 로그에 의존하지 말고 매니페스트 검사를 통과해야만 기기에 도달하도록 구성하며, 미검증 동작은 허용하지 않고 운영자 승인 절차로 넘기는 편이 안전합니다.
- 접근성 트리 전체를 그대로 모델에 전달하기보다 화면에서 필요한 항목을 추출하고 상품명과 가격처럼 구조화된 결과로 변환하면 긴 다중 화면 탐색의 출력 부담을 줄일 수 있습니다
섹션별 상세
용어 해설
- 온디바이스 에이전트(On-device Agent)
- — 클라우드 API 대신 스마트폰 내부에서 모델을 실행하며 화면을 읽고 도구를 호출하는 에이전트입니다. 네트워크 없이도 기기 명령을 처리할 수 있다는 점이 핵심입니다.
- 접근성 트리(Accessibility Tree)
- — Android 화면의 버튼, 텍스트, 입력 요소 같은 UI 구조를 계층 형태로 제공하는 데이터입니다. 에이전트가 화면을 해석하고 앱을 조작하는 입력으로 쓰입니다.
- GGUF
- — 로컬 추론에 사용하는 양자화 모델 파일 형식입니다. 이 글에서는 스마트폰에서 실행할 온디바이스 모델을 다섯 가지 사전 설정과 함께 교체하는 방식으로 활용합니다.
- 프롬프트 인젝션(Prompt Injection)
- — 모델이 원래 지시를 무시하고 공격자가 삽입한 명령을 따르도록 유도하는 공격입니다. 글쓴이는 112개 모델을 대상으로 방어 성능을 측정한 연구 프로젝트와 같은 게이트 구조를 적용했습니다.
- 정책 게이트(Policy Gate)
- — 도구 호출이 실제 기기에 도달하기 전에 허용된 동작인지 검사하는 통제 계층입니다. 매니페스트에 없는 동작은 기록만 하고 통과시키지 않고 차단하며, 필요한 경우 운영자의 탭으로 승인합니다.
언급된 도구
70B 클라우드 모델을 호출하는 제공자로 사용되며 개인 키를 통해 연결됩니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.