본문으로 건너뛰기
r/LLMDevs조회 3

Gemma 3 1B 기반 오프라인 Android 에이전트

Gemma 3 1B가 네트워크 없이 Android 명령을 처리하고 복잡한 작업은 70B 모델로 넘깁니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Gemma 3 1B를 스마트폰에서 직접 실행해 네트워크 없이 Android 화면을 읽고 30개 도구를 호출하는 자율 에이전트를 구현했습니다. 배터리 확인이나 손전등 전환처럼 단순한 명령은 1B 모델이 처리하고, 복잡한 작업만 70B 클라우드 모델로 넘기며 라우팅 자체는 별도의 모델 호출 없이 결정론적으로 수행합니다. 모든 도구 호출은 매니페스트를 확인하는 정책 게이트를 거치고, 검증되지 않은 동작은 차단한 뒤 운영자 탭을 요구합니다. 134개 단위 테스트와 8개 기기 회귀 테스트, 약 8.7MB의 Release APK, 20개 화면에 걸친 Amazon 상품·가격 묶음 추출이 구현 근거로 제시됐지만, 낯선 앱에서의 단계 효율과 음성 인식 범위는 아직 제한적입니다.

실용적 조언

  • 단순하고 반복적인 기기 명령은 온디바이스 소형 모델에 배정하고 복잡한 작업만 클라우드 모델로 넘기되, 라우팅 기준은 별도 모델 호출 없이 결정론적으로 고정하는 방식이 적합합니다.
  • 도구 호출은 실행 후 감사 로그에 의존하지 말고 매니페스트 검사를 통과해야만 기기에 도달하도록 구성하며, 미검증 동작은 허용하지 않고 운영자 승인 절차로 넘기는 편이 안전합니다.
  • 접근성 트리 전체를 그대로 모델에 전달하기보다 화면에서 필요한 항목을 추출하고 상품명과 가격처럼 구조화된 결과로 변환하면 긴 다중 화면 탐색의 출력 부담을 줄일 수 있습니다

섹션별 상세

01
이 에이전트는 음성 요청을 입력으로 받아 화면을 읽고, 다음 동작을 결정하고, 도구를 실행한 뒤 성공 여부를 확인하는 순환 구조로 Android를 조작합니다. 손전등, 클립보드, SMS, 앱 실행, 웹 검색을 포함한 30개 도구가 접근성 트리를 통해 여러 앱의 UI에 접근하며, 사이드 버튼으로 호출한 요청에는 음성으로 응답합니다. 앱이 백그라운드에 있어도 도구 실행과 음성 응답이 이어지는 hands-free assist가 확인됐고, 이 구조는 단순한 명령을 네트워크 왕복 없이 처리하는 데 초점을 둡니다.
02
단순한 기기 명령에는 Gemma 3 1B를 사용하고 복잡한 작업에는 70B 클라우드 모델을 사용하도록 분기해 작은 모델의 추론 한계를 범위 제한으로 다룹니다. 어떤 모델을 호출할지 결정하는 과정에는 별도 모델을 쓰지 않고 결정론적 라우터를 적용하므로, 라우팅 결과가 또 다른 추론에 좌우되지 않습니다. 작성자는 1B 모델이 복잡한 문제를 풀 필요 없이 배터리 잔량 확인, 손전등 전환, 앱 열기 같은 짧은 명령을 빠르게 처리하면 온디바이스 실행만으로도 실용성이 생긴다고 평가합니다.
03
기기 조작의 안전성은 실행 후 로그를 남기는 방식이 아니라 실행 전에 차단하는 정책 게이트로 통제합니다. 각 도구 호출은 매니페스트에 등록된 동작인지 검사받고, 추적되지 않은 호출은 기기에 도달하지 못하며 게이트가 판단을 보류한 경우 운영자가 탭으로 승인합니다. 이 구조는 글쓴이가 112개 모델을 대상으로 프롬프트 인젝션 방어를 측정했던 별도 연구 프로젝트에서 가져왔으며, 이번 Android 에이전트에서는 같은 구조를 기기 내부에 강제합니다.
04
구현 결과에는 134개 단위 테스트와 8개 항목의 기기 회귀 테스트, R8로 축소한 약 8.7MB Release APK가 포함됩니다. Amazon 검색 결과 페이지 20개 화면을 읽어 원시 접근성 트리 대신 상품과 가격을 묶어 반환하고, 한 번 가르친 다단계 작업을 새 대화에서 재생하는 named recipe도 제공합니다. 다만 낯선 앱에서의 단계 효율은 아직 모델 조정이 필요하고, 1B 모델의 few-shot 예시 반복으로 로그가 지저분해지며, 음성 전사는 구문 의존성이 있고 합성 음성으로만 검증됐습니다.

용어 해설

온디바이스 에이전트(On-device Agent)
클라우드 API 대신 스마트폰 내부에서 모델을 실행하며 화면을 읽고 도구를 호출하는 에이전트입니다. 네트워크 없이도 기기 명령을 처리할 수 있다는 점이 핵심입니다.
접근성 트리(Accessibility Tree)
Android 화면의 버튼, 텍스트, 입력 요소 같은 UI 구조를 계층 형태로 제공하는 데이터입니다. 에이전트가 화면을 해석하고 앱을 조작하는 입력으로 쓰입니다.
GGUF
로컬 추론에 사용하는 양자화 모델 파일 형식입니다. 이 글에서는 스마트폰에서 실행할 온디바이스 모델을 다섯 가지 사전 설정과 함께 교체하는 방식으로 활용합니다.
프롬프트 인젝션(Prompt Injection)
모델이 원래 지시를 무시하고 공격자가 삽입한 명령을 따르도록 유도하는 공격입니다. 글쓴이는 112개 모델을 대상으로 방어 성능을 측정한 연구 프로젝트와 같은 게이트 구조를 적용했습니다.
정책 게이트(Policy Gate)
도구 호출이 실제 기기에 도달하기 전에 허용된 동작인지 검사하는 통제 계층입니다. 매니페스트에 없는 동작은 기록만 하고 통과시키지 않고 차단하며, 필요한 경우 운영자의 탭으로 승인합니다.

언급된 도구

Venice중립

70B 클라우드 모델을 호출하는 제공자로 사용되며 개인 키를 통해 연결됩니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 06.수집 2026. 09. 06.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.