본문으로 건너뛰기

복합 실세계 작업을 평가하는 모바일 에이전트 벤치마크

MobilePA-Bench는 1,705개 모바일 작업에서 도구 호출·기억·Skill·Sub-agent 협업을 상태 유지형 샌드박스로 평가하며 최고 Overall 75.52%를 기록했다.

용어 해설

상태 유지형 샌드박스(Stateful Sandbox)
상태 유지형 샌드박스는 에이전트의 도구 호출에 따라 애플리케이션 데이터베이스와 실행 로그를 계속 갱신하는 실행 환경이다. MobilePA-Bench에서는 도구 스키마, 실행 코드, 영속 데이터베이스를 결합하고 상태 변화와 오류를 구조화된 피드백으로 반환한다. 이를 통해 정적인 함수 문자열 일치가 아닌 실제 실행 순서와 오류 복구 능력을 측정한다.
도구 호출(Tool Calling)
도구 호출은 언어 모델이 자연어 요청을 실행 가능한 함수 이름과 JSON 인자로 변환해 외부 기능을 사용하는 방식이다. 이 논문에서는 직접 모바일 API 호출뿐 아니라 Memory 검색, Sub-agent 위임, Skill 로딩도 같은 구조화된 함수 인터페이스로 표현한다. 따라서 도구 선택, 인자 연결, 선행 조건 준수, 실행 결과에 따른 재계획을 하나의 과정으로 평가한다.
Sub-agent 협업(Sub-agent Collaboration)
Sub-agent 협업은 중앙 Planner가 직접 처리하기 어려운 시각 조작이나 조건 감시 같은 작업을 전문 하위 에이전트에 전달하는 구조다. 중앙 에이전트는 적절한 경로를 선택하고 작업 지시와 실행 맥락을 함께 넘기며, 하위 에이전트의 결과를 받아 전체 흐름을 이어간다. MobilePA-Bench는 위임 경로와 handoff payload의 완전성을 행동 검증 기준으로 삼는다.
메모리 사용(Memory Usage)
메모리 사용은 저장된 사용자 프로필, 선호도, 과거 기록을 검색한 뒤 모호한 요청의 실행 인자에 반영하는 능력이다. 필요한 Memory ID를 모두 검색하고 후속 도구 호출에 올바르게 활용해야 최종 작업이 성공한다. 논문에서는 단일 기록 연결, 충돌 기록 해결, 여러 기록 조합을 포함한 376개 작업으로 이 능력을 측정한다.
Skill 사용(Skill Usage)
Skill 사용은 여러 원자적 도구 호출을 매번 새로 계획하지 않고, 미리 묶인 composite skill을 불러와 관련 실행 도구를 동적으로 추가하는 방식이다. Skill loader 호출 뒤 환경은 해당 Skill에 연결된 도구 스키마를 다음 단계의 action space에 합친다. 이 구조는 장기 실행에서 단계별 계획 오류가 누적되는 문제를 줄이지만, 올바른 Skill 선택과 후속 실행이 모두 필요하다.
증거 정렬형 검증(Evidence-Aligned Verification)
증거 정렬형 검증은 모든 작업에 동일한 성공 기준을 적용하지 않고, 완료를 가장 잘 입증하는 관찰 증거에 맞춰 검증기를 선택하는 방식이다. MobilePA-Bench는 정확한 함수 순서를 검사하는 Tool Call, 최종 데이터베이스 변화를 검사하는 State Change, 위임과 사용자 상호작용을 검사하는 Agent Behavior로 작업을 나눈다. Memory 검색과 Skill 로딩은 이 기본 검증기에 별도 gate로 결합한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 24.수집 2026. 08. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.