본문으로 건너뛰기

iOSWorld: 개인 맞춤형 전화 에이전트를 위한 벤치마크

현대 스마트폰은 여러 앱에 걸친 개인 데이터를 보유한다. 이러한 데이터를 활용해 사용자 의도와 과거 행동을 파악하는 에이전트의 능력이 핵심적이다. 기존 벤치마크는 cross-app 맥락과 개인화 요소를 충분히 반영하지 못한다. iOSWorld는 26개 네이티브 앱에 걸친 지속적 사용자 아이덴티티를 기반으로 133개의 태스크를 제시하고, 단일 앱에서 다중 앱으로 이어지는 맥락 추론과 기억 능력을 정량적으로 평가한다.

왜 중요한가

현대 스마트폰은 여러 앱에 걸친 개인 데이터를 보유한다. 이러한 데이터를 활용해 사용자 의도와 과거 행동을 파악하는 에이전트의 능력이 핵심적이다. 기존 벤치마크는 cross-app 맥락과 개인화 요소를 충분히 반영하지 못한다. iOSWorld는 26개 네이티브 앱에 걸친 지속적 사용자 아이덴티티를 기반으로 133개의 태스크를 제시하고, 단일 앱에서 다중 앱으로 이어지는 맥락 추론과 기억 능력을 정량적으로 평가한다.

핵심 기여

지속 가능한 사용자 아이덴티티를 중심으로 한 iOS 시뮬레이터 벤치마크

26개 네이티브 iOS 앱에 걸쳐 하나의 퍼시스턴트 아이덴티티(Jordan Avery)를 공유하고 수집된 데이터를 연결해 에이전트의 개인화 추론 능력을 측정한다.

133개 태스크를 통한 세 가지 난이도 카테고리

단일 앱(27), 다중 앱(60), 메모리/개인화 태스크(46)로 구성되며, 개인 데이터로부터 implicit 패턴을 추론하는 능력을 평가한다.

비전-단일/비전+XML 두 가지 관측 모드와 의사결정 도구 확장

시각 정보만으로도 작동하는 vision-only 모드와 XCUITest를 통한 접근성 트리(XML)를 포함하는 vision+XML 모드를 비교한다. 후자는 tap/launch app 등 확장된 액션을 제공한다.

LLM-판정자(trajectory-level)와 인간 검증의 높은 일치도

GPT-5.4-Mini를 사용한 트랙터리 판정에서 인간 평가자와 κ=0.77의 task-level 일치를 보였고, rubric 수준의 신뢰도도 높다.

오픈소스와 재현성 보장

앱, Seed 데이터, 태스크, 루브릭, 평가 코드를 포함한 오픈소스 배포 및 AWS Mac 런너를 제공해 비맥 연구자도 벤치마크를 재현할 수 있다.

핵심 아이디어 이해하기

단계 1: 문제 정의에서 개인화된 에이전트는 단일 앱 상태에 국한되지 않고 사용자 아이덴티티와 히스토리에 의존한다. 기존 벤치마크가 이를 반영하지 못한다. 단계 2: iOSWorld는 Jordan Avery라는 페르소나를 26개 앱에 걸쳐 공유 데이터로 연결하고, 앱 간 데이터 연결성을 통해 교차-앱 추론을 요구한다. 단계 3: 두 관측 모드(vision-only, vision+XML)와 모바일용 CUAs를 iOS에 맞게 변환해 실험 가능하게 한다. 단계 4: 평가 프레임워크로 LLM-as-a-judge를 도입하고, 인간 평가와의 일치를 확인한다. 단계 5: 결과적으로 강력한 frontier 모델일수록 XML 접근으로 성능이 크게 개선되며, 작은 모델은 같은 이점을 얻지 못한다.

관련 Figure

Jordan Avery의 디지털 라이프를 보여주는 다이어그램. 앱 간 데이터를 공유하는 26개 앱의 관계를 나타낸다.
Diagram

개인화 데이터의 Across-app 공유가 태스크 간 의존성 형성에 어떻게 기여하는지 보여준다. 연구의 개인화 시나리오를 지지한다.

Jordan Avery의 디지털 라이프를 보여주는 다이어그램. 앱 간 데이터를 공유하는 26개 앱의 관계를 나타낸다.

방법론

환경은 POMDP로 모델링된다(S,S,A,Ω,T). 관측 공간은 vision-only(스크린샷)과 vision+XML(XCUITest로 얻은 접근성 트리)을 포함한다. 액션은 모드에 따라 tap x/y, type, swipe, launch app 등으로 구성되며, XML에서 접근성 식별자를 이용한 tap도 가능하다. Table 1은 모드별 액션 매핑을 제시한다. iOSWorld의 CUAs를 iOS로 매핑하기 위한 번역 계층이 도입되며, 0-1000 스케일의 좌표를 사용한다. Stage-1: Claude Code로 26앱의 seed 데이터와 앱 소스 기반 태스크를 생성한다. Stage-2: Python 파이프라인으로 앱명 정규화, 태스크 문장화 및 루브릭 생성, Stage-3: 사람 평가자에 의해 엔드투엔드 실행 확인. Stage-4: 평가는 trajectory-level LLM-judge(GPT-5.4 Mini)로 수행하고, 사람 검증과 κ=0.77의 일치를 확인한다.

관련 Figure

iOSWorld 개요 다이어그램. 26개 앱과 133 태스크, 1 persistent user identity를 연결한 아키텍처를 시각화한다.
Infographic

논문의 방법론과 벤치마크 구성의 핵심 요점을 한 장으로 요약한다. 플랫폼 구성과 데이터 연결의 시각화로 연구의 전체 구조를 직관적으로 파악할 수 있다.

iOSWorld 개요 다이어그램. 26개 앱과 133 태스크, 1 persistent user identity를 연결한 아키텍처를 시각화한다.

DineSpot-클러스터의 MCP 도구를 통한 예약 태스크 흐름과 cookbook 입력의 차이 비교.
Diagram

MCP 도구의 구조적 도입이 태스크 성공에 어떻게 기여하는지 구체적인 수행 흐름으로 보여준다.

DineSpot-클러스터의 MCP 도구를 통한 예약 태스크 흐름과 cookbook 입력의 차이 비교.

MCP 도구 ablation의 비교 그림. 구조화된 도구 대 cookbook 모바일 사용 도구의 차이를 보여준다.
Infographic

도구 인터페이스 차이가 태스크 성공률에 미치는 영향을 정량적으로 비교한다. 구조화 도구의 이점이 강조된다.

MCP 도구 ablation의 비교 그림. 구조화된 도구 대 cookbook 모바일 사용 도구의 차이를 보여준다.

주요 결과

주요 결과는 Vision+XML이 강력한 frontier 모델의 성능을 크게 끌어올린다는 점이다. Opus 4.6은 Overall 52%로 상승했고 Single-App는 82%, Memory 54%, Multi-App는 37%에 도달했다. Sonnet 4.6은 47%, GPT-5.4는 40%로 상승했다. 반면 Qwen3.5 35B-A3B는 Vision+XML에서도 이득이 작지 않아도 제한적이며, Multi-App에서의 개선은 크지 않다. 예시로 Memory-trajectory에서 Opus가 29단계의 메모리 태스크에서 54%를 기록하는 등 메모리 태스크가 상대적으로 잘 해결되나, Multi-App 태스크가 가장 어렵다. 실패 원인은 예산 소진(budget exhausted)이 전체 실패의 큰 부분을 차지하며, 약 50% 이상이 해당 원인으로 분류된다. 인간-판정자와의 일치도는 task 수준에서 κ=0.77로 확인되었다. 오픈소스 도입으로 재현성과 확장이 가능하다.

관련 Figure

Nobu 주문 다이너스티를 다루는 QuickBite와 TeamChat의 다중 앱 태스크 비교 예시.
Diagram

다중 앱 태스크에서 vision-only와 vision+XML의 차이를 시각적으로 보여준다. 접근성 트리의 도입으로 각 태스크의 수행 경로가 달라짐을 시사한다.

Nobu 주문 다이너스티를 다루는 QuickBite와 TeamChat의 다중 앱 태스크 비교 예시.

메모리 태스크의 성공 궤적 예시. Opus 4.6의 29단계 메모리 태스크에서의 기억-생성 시나리오를 보여준다.
Screenshot

메모리 태스크의 장기 계획과 데이터 합성의 중요성을 시각적으로 확인시켜준다. 성능 향상의 주요 원인이 메모리 통합임을 시사한다.

메모리 태스크의 성공 궤적 예시. Opus 4.6의 29단계 메모리 태스크에서의 기억-생성 시나리오를 보여준다.

Frontier 모델의 성능 차이를 단계별 누적 패스율로 비교한 그래프. Vision+XML의 이점이 모델에 따라 다름을 보여준다.
Chart

비전-XML 입력이 일부 대형 모델의 누적 패스율을 크게 증가시키지만, 규모가 작은 모델은 이득을 보지 못하는 경향을 수치로 제시한다.

Frontier 모델의 성능 차이를 단계별 누적 패스율로 비교한 그래프. Vision+XML의 이점이 모델에 따라 다름을 보여준다.

기술 상세

구현 레이어는 macOS에서 Appium + XCUITest 드라이버를 이용해 iOS 시뮬레이터를 제어한다. 8개의 병렬 워커와 24GB MacBook Pro 수준의 리소스로 2–4GB RAM의 시뮬레이터 인스턴스를 구동한다. Task의 길이는 최대 50단계이며, 각 단계마다 스크린샷이 첨부된다. 평가 방식은 trajectory를 기반으로 하는 LLM-judge로, 128개의 Trajectories에서 κ=0.77의 task-level 일치도를 확인했다. Cross-judge 실험에서도 일치도는 0.49~0.66 사이로 확인되며, 피험자별 변동성을 낮추기 위해 단계별 루브릭 점수와 최종 binary 성공 여부를 함께 보고한다. iOS 고유의 인터랙션 특성(좌측 스와이프를 통한 뒤로 가기, 좌표 기반 목표 식별의 어려움)이 비전-only에서 10%대의 좌표 간격 재시도율로 나타났고, XCUITest 접근성 트리의 대체 입력이 경우에 따라 큰 차이를 만들었다.

실무 활용

iOS 환경에서 개인화된 모바일 에이전트의 연구와 개발에 직접 사용할 수 있는 벤치마크이다. 26개 앱에 걸쳐 개인 데이터를 연결하고 across-app 추론 및 기억 문제를 다루며, 프런티어 모델의 한계와 XML 접근의 효과를 정량적으로 평가한다.

  • 개인화 추론과 메모리 관리 평가
  • UI 인터랙션에 대한 비전 기반 멀티모달 에이전트의 성능 비교
  • MCP 도구를 통한 애플리케이션 간 협력성 평가
  • 개인정보 보호 및 프라이버시 설계가 포함된 에이전트 설계 검증
  • 새로운 persona 및 태스크 확장 시 벤치마크 재생성

코드 공개 여부: 공개

코드 저장소 보기

키워드

iOSWorldpersistent identitymobile-agent benchmarksvision-onlyvision+XMLaccessibility-treeXCUITestMCPPOMDP

용어 해설

XCUITest
iOS의 자동화 테스트 프레임워크로서 UI 요소의 접근성 트리를 수집하고 상호작용을 제어하는 도구. iOSWorld에서는 XML 접근성 트리와 함께 사용되어 privileged 입력을 제공한다.
vision+XML
비전 기반 입력에 추가로 접근성 트리(XML 형식의 구조화된 UI 정보)를 제공하는 설정. 화면시각 정보와 구조화된 요소 정보를 함께 사용해 UI 상호작용을 개선한다.
부분 관측 마르코프 결정 과정(POMDP)
에이전트가 관측 가능한 부분 정보만 얻는 확률적 의사결정 문제를 서술하는 모델. iOSWorld의 환경은 st→ot→st+1의 부분 관측 상태로 표현된다.
MCP 도구(MCP Tools)
다양한 애플리케이션 간의 구조화된 도구 계층으로, per-app 명령을 통해 앱 간 협업을 가능하게 하는 도구 서버. iOSWorld에서 XML 기반 접근성과 함께 사용된다.
프런티어 모델(frontier models)
최신 대형 모델 계열로서 비전-텍스트 작업에서 최고 성능을 보이는 모델들. iOSWorld의 평가에서 핵심 비교 대상이 된다.
LLM-판정자(LLM-as-a-judge)
대형언어모델을 트랙터리(trajectory) 수준의 채점자로 활용하여 태스크 수행 여부와 Rubric 기준 충족 여부를 판단하는 평가 방식.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 08.수집 2026. 06. 19.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.