왜 중요한가
대부분의 LLM 기반 에이전트는 데스크톱이나 서버에서 GUI 시뮬레이션을 통해 모바일을 제어해왔고 이 방식은 화면 레이아웃 변화와 긴 동작 시퀀스에 취약하다. PalmClaw은 에이전트 구성 요소를 모바일 기기 내부에서 호스팅하고 장치 기능을 구조화된 툴로 노출하여 GUI 의존을 줄였다. 그 결과 사용자 권한과 파일 경계가 명확히 관리되며 실사용성 측면에서 성공률과 응답 속도 측면에서 유의한 성능 개선이 확인되었다.
핵심 기여
모바일 내 에이전트 호스팅 구성
PalmClaw은 세션 관리, 영속 메모리, 스킬 로딩, 툴 레지스트리, 에이전트 루프 등 에이전트 핵심 구성요소를 모두 모바일 애플리케이션 내부에 배치했다. 이 배치는 외부 컴퓨터나 브리지 연결 없이도 에이전트가 기기 자원에 직접 접근하고 상태를 유지할 수 있게 했다. 구현 결과 설치 단계와 운영 요구가 줄어들어 초기 설정 시간이 크게 단축되었다.
장치 기능을 명시적 인수와 구조화된 결과로 제공하는 디바이스 툴 설계
각 디바이스 툴은 모델이 사용할 수 있는 이름·설명·JSON 인수 스키마와 기기 측 실행 함수를 한 쌍으로 연결한다. 호출 전 스키마 검증, 권한 확인, 워크스페이스 경계 검사라는 세 단계 검사를 적용해 실행 경계를 명확히 했다. 이 설계는 GUI 기반의 긴 네비게이션 시퀀스를 단일 구조화 호출로 대체하여 토큰과 라운드 수를 줄이는 데 기여했다.
온디바이스 평가에서 성능 및 효율성 검증
MobileTask와 AssistantBench에서 PalmClaw은 가장 강력한 비교대상 대비 작업 성공률을 11.5% 상대 향상시키고 평균 완료 시간을 94.9% 단축했다. 실험은 Android 기기에서 DeepSeek-V4-Flash를 LLM 백본으로 사용해 수행되었으며, 토큰 사용량과 API 호출 수도 현저히 감소했다. 트레이스 분석을 통해 권한 요청과 워크스페이스 경계 처리 사례를 제시하여 설계의 실무적 유효성을 보였다.
핵심 아이디어 이해하기
에이전트의 기본 문제는 LLM이 환경과 상호작용할 때 관찰과 행동을 연결하는 방식에 있다. 기존 모바일 에이전트는 화면의 스크린샷을 관찰하고 탭·스와이프 같은 GUI 연쇄 동작으로 목표를 달성하는데, 이 방식은 인터페이스 변화에 취약하고 단계가 많아 지연과 실패가 잦다. PalmClaw은 이러한 긴 GUI 시퀀스를 제거하고 장치 자원을 함수형 툴로 노출하여 모델의 출력이 직접 실행 가능한 구조체(툴 호출)로 전환되게 했다.
방법론
PalmClaw는 입력을 세션에 할당한 뒤 여섯 가지 소스(시스템 지침, 런타임 컨텍스트, 공유 메모리, 활성 스킬과 스킬 요약, 최근 대화와 툴 트레이스, 사용 가능한 툴 스펙)를 조합해 모델 컨텍스트를 구성한다. 모델에는 메시지와 함께 툴 스펙이 제공되며 원격 LLM API는 이 컨텍스트로부터 응답을 반환한다. 응답에 툴 호출이 포함되면 PalmClaw가 기기 내 툴 레지스트리와 매칭해 스키마·권한·워스페이스 검사를 순차 적용한 뒤 해당 기기 함수를 실행하고 그 결과를 세션에 구조화된 형태로 저장한다.
관련 Figure

그림 왼쪽은 데스크톱 또는 클라우드에서 GUI 상태와 액션을 주고받는 전통적 접근을 나타내며 긴 GUI 시퀀스와 외부 의존성을 시각화하고 있다. 오른쪽은 PalmClaw가 세션, 메모리, 스킬, 툴, 에이전트 루프를 기기 내부에 두고 디바이스 툴을 통해 직접 리소스에 접근하는 흐름을 보여준다. 이 다이어그램은 설계 목표인 실행 경계의 명시성과 툴 기반 상호작용이 GUI 기반 접근보다 라운드 수와 지연을 줄이는 이유를 직관적으로 보강한다.
PalmClaw의 전체 구조를 비교한 다이어그램으로 외부 호스팅 기반 GUI 에이전트와 모바일 내 호스팅 에이전트의 차이를 보여주고 있다.
주요 결과
주요 벤치마크 결과에서 PalmClaw은 MobileTask에서 비교대상 중 가장 높은 성공률 97.1%를 기록했고 평균 완료 시간은 17.7초로 표시되어 GUI 기반 대조군보다 평균 시간이 94.9% 단축되었다. 토큰 사용량과 액션 수(LLM 호출 기준)도 대조군보다 현저히 적어 지연과 비용 측면의 개선이 확인되었다. 추가로 배포·운영 비교에서는 별도 컴퓨터·CLI·브리지 없이 모바일에서 직접 실행되므로 설정 단계와 소요 시간이 줄어들었음이 관찰되었다.
관련 Figure

왼쪽 트레이스는 캘린더 접근 권한이 없을 때 권한 요청 플로우를 거쳐 사용자가 허용하면 동일 작업을 계속 수행하는 과정을 순차적으로 보여준다. 오른쪽 트레이스는 /sdcard 같은 외부 경로가 워크스페이스 경계를 벗어날 경우 앱 설정으로 사용자를 안내해 수동으로 접근 권한을 부여하도록 요구하는 흐름을 나타낸다. 이 그림은 PalmClaw의 검사 단계(스키마·권한·워크스페이스)가 실제 상호작용에서 어떻게 중단과 재시작을 유도하는지를 시각적으로 뒷받침한다.
권한과 워크스페이스 경계를 보여주는 실행 트레이스 사례로 캘린더 권한과 외부 파일 경로 접근 처리 흐름을 제시하고 있다.
기술 상세
아키텍처는 모바일 애플리케이션 내부에 세션, 메모리, 스킬, 툴 레지스트리, 에이전트 루프를 포함한다. 각 세션은 대화 내용, 툴 트레이스, 첨부파일, 세션 전용 워크스페이스를 저장하며 입력은 기존 세션으로 라우팅되거나 신규 세션으로 생성된다. 메모리는 장기 공유 메모리와 세션별 요약 두 계층으로 유지되며 일정 창이 채워지면 별도 LLM 호출로 과거 메시지를 요약해 두 계층을 갱신한다.
관련 Figure

이 표는 각 기능군이 어떤 스킬 이름과 API 형태의 툴 호출을 제공하는지를 구체적으로 보여준다. 예컨대 파일 작업에는 list(), read(), write() 같은 명시적 함수들이 있고 권한이나 워크스페이스 경계와 결합되어 동작하도록 설계되었음이 드러난다. 이 그림은 설계 상 툴이 모델에 제공되는 방식과 호출-검증-실행 경로를 연결해 이해하는 데 도움을 준다.
PalmClaw에 내장된 스킬과 툴 그룹을 표 형식으로 정리한 그림으로 디바이스·미디어·파일·웹·자동화·메모리 관련 함수 목록을 나열하고 있다.
한계점
논문에서 명시된 제한 중 하나는 일부 파일 경로나 전역 접근이 기기 설정 수준의 권한(예: all files access)을 필요로 하여 자동 권한 프롬프트로 해결되지 않는다는 점이다. PalmClaw는 LLM 추론을 원격 API로 제공하므로 원격 제공자에 의한 데이터 흐름과 프라이버시 문제가 남아 있다는 점이 지적되었다. 또한 평가와 구현은 특정 Android 기기와 특정 LLM 백본(DeepSeek-V4-Flash)에 기반해 수행되어 다른 하드웨어·모델 환경에서 동일한 성능을 보장한다는 주장은 논문에서 제한적으로 다루어졌다.
실무 활용
PalmClaw은 모바일 애플리케이션 개발자와 시스템 통합 담당자가 사용자 기기 내에서 자동화된 작업을 안전하게 수행하도록 설계된 프레임워크이다. 디바이스 툴과 워크스페이스 경계를 통해 민감한 권한과 파일 접근을 제어하면서도 반복 작업을 간결한 툴 호출로 치환해 응답 지연을 줄였다. GitHub에 설치 패키지와 소스가 공개되어 있어 실제 앱에 통합해 실험적으로 적용할 수 있다.
- 캘린더 예약과 같은 개인 정보 기반 작업을 권한 흐름과 함께 자동화하여 사용자가 수동으로 앱을 조작할 필요를 줄이는 상황
- 세션별 워크스페이스를 활용해 노트·리스트·임시 파일을 에이전트가 안전하게 생성·수정하는 파일 관리 작업
- 미디어·연결 장치(Bluetooth)·연락처를 직접 호출 가능한 툴로 제어하는 일상적 모바일 자동화
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 디바이스 툴(Device Tools)
- — 모바일 장치의 기능과 리소스를 명시적 인수와 구조화된 결과로 노출하는 호출 가능한 인터페이스이다. PalmClaw 맥락에서는 캘린더, 파일, 미디어, 권한 체크 같은 장치 서비스에 JSON 스키마로 정의된 인수를 전달하고 구조화된 반환값을 받는 실행 단위로 동작한다. 이 방식은 GUI 액션의 연속 대신 단일 호출로 작업을 수행하게 하여 실행 경계를 명확히 하고 실패 원인을 구조적으로 처리할 수 있게 한다.
- 에이전트 루프(Agent Loop)
- — LLM 호출과 툴 실행을 반복하는 다중 라운드 상호작용 구조로서, 각 라운드에서 컨텍스트를 재구성하고 모델의 응답에 따라 툴을 호출하거나 최종 응답을 반환한다. PalmClaw에서는 원격 LLM API로 메시지와 툴 스펙을 보내고, 툴 호출이 있으면 기기에서 실행 결과를 받아 세션에 저장한 뒤 다음 라운드를 진행한다. 이 구조는 단계별 관찰과 행동을 연결해 복합 작업을 완결할 수 있게 한다.
- 워크스페이스 경계(Workspace Boundary)
- — 파일 접근과 쓰기 작업이 허용되는 세션 전용 저장 영역과 기기 전역 또는 공용 경로를 구분하는 정책적·실행적 제한이다. PalmClaw에서는 파일 경로를 해석하여 현재 세션의 워크스페이스와 승인된 공유 저장소만 자동 허용하고, 공용 경로나 외부 쓰기 요청에는 사용자 확인이나 설정 변경을 요구한다. 이 경계는 에이전트의 무분별한 전역 접근을 차단하고 권한 관련 실패를 구조적으로 관리하기 위해 도입되었다.
- 스킬 파일(SKILL.md)
- — 재사용 가능한 작업 지침과 절차를 텍스트로 저장한 파일로서, 에이전트 컨텍스트에 포함되어 특정 작업을 수행하는 데 필요한 도구 사용법과 단계별 규칙을 제공한다. PalmClaw에서는 항상 활성화된 스킬과 최근 메시지에 매칭되는 스킬을 선택적으로 로드하여 컨텍스트 크기를 제어한다. 이 방식은 관련 지침만 불러와 토큰 비용을 줄이면서 일관된 작업 실행을 가능하게 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
