본문으로 건너뛰기

LLM의 Android UI 조작 능력 벤치마킹 및 평가 방법론 연구

LLM이 인간처럼 모바일 UI를 조작하는 능력을 측정하기 위해 Android 테스트 하네스를 구축하고 1,700회 이상의 실험을 통해 모델별 성능과 평가 방법론의 중요성을 분석했다.

섹션별 상세

LLM이 인간의 시각적 인터페이스만을 사용하여 모바일 작업을 수행할 수 있는지 검증하기 위해 MCP 기반의 Android 테스트 하네스를 개발했다. 이 시스템은 모델에게 스크린샷을 제공하고 터치, 스와이프, 하드웨어 버튼 조작 등의 제한된 액션만 허용한다. 내부적으로는 ADB를 사용하여 에뮬레이터를 제어하지만 모델은 이에 직접 접근할 수 없도록 설계했다. 이를 통해 모델의 공간 추론 능력과 다단계 계획 수립 능력을 순수하게 측정할 수 있는 환경을 구축했다.
테스트는 비행기 모드 전환, 알람 설정, 앱 삭제 등 4가지 안정적인 작업을 대상으로 1,700회 이상 반복 수행하여 통계적 유의성을 확보했다. 각 작업은 단순한 성공 여부를 넘어 모델이 UI 변화를 어떻게 인식하고 반응하는지 관찰할 수 있도록 구성했다. 예를 들어 비행기 모드 테스트에서는 아이콘의 상태 변화를 인식해야 하며, 알람 설정에서는 복잡한 타임 피커 조작 능력을 평가한다. 이러한 반복 실험을 통해 모델 성능의 변동성을 파악하고 신뢰 구간을 산출했다.
실험 결과 GPT-5.3 Codex 모델이 GPT-5.4보다 3개 작업에서 더 높은 성공률을 기록하며 에이전트 특화 튜닝의 중요성을 시사했다. Codex 변체는 도구 사용에 최적화되어 있어 일반 목적 모델보다 UI 조작에서 더 정교한 성능을 보였다. 이는 모델의 파라미터 규모나 최신성보다 특정 도메인에 대한 적합성이 실무 성과에 더 큰 영향을 미칠 수 있음을 보여준다. 서버 부하 등의 변수를 제외하더라도 작업 수준의 테스트가 모델 간의 실질적 차이를 드러내는 데 유용함을 입증했다.
성공 여부 판단 시 모호한 점수 대신 ADB를 활용해 시스템 상태를 직접 확인하는 결정론적 검증 방식을 채택하여 신뢰도를 높였다. 설정 값이 실제로 변경되었는지 또는 패키지가 삭제되었는지를 셸 명령어로 확인하여 부분 점수 없는 엄격한 통과 기준을 적용했다. 모델의 행동은 매번 다를 수 있지만 채점 기준은 변하지 않아야 한다는 원칙을 고수했다. 이러한 방식은 평가자의 주관이나 두 번째 모델의 판단에 의존하는 방식보다 훨씬 객관적인 데이터를 제공한다.
테스트 과정에서 알림 배너를 통해 정보를 가로채는 등의 변수를 발견하고 이를 배제하기 위해 리플레이 시각화 도구를 구축하여 데이터의 품질을 관리했다. 특정 모델이 메시지 앱을 열지 않고도 상단 배너에서 인증 코드를 읽어 성공하는 사례를 발견하여 해당 테스트를 제외했다. 이는 수치상으로는 성공으로 나타나더라도 실제 의도한 능력을 측정하지 못하는 나쁜 테스트를 걸러내는 과정이었다. 디버깅 도구 없이는 발견하기 어려운 이러한 정교한 오류들을 리플레이 분석을 통해 해결했다.
모델이 받는 스크린샷의 왜곡 문제를 시각화 도구로 발견함으로써 데이터 파이프라인의 잠재적 오염을 방지하는 가시성의 중요성을 입증했다. 서버 측의 이미지 클램핑과 스케일링 함수 오류로 인해 모델이 실제와 다른 비율의 이미지를 추론에 사용하는 문제를 포착했다. 만약 이 도구가 없었다면 모델은 잘못된 시각 데이터를 바탕으로 행동을 학습하게 되어 전체 파이프라인이 오염되었을 것이다. 코드 자체보다 도구와 가시성이 에이전트 개발에서 더 중요하다는 교훈을 남겼다.

기술

  • Android
  • MCP
  • GPT-5.4
  • GPT-5.3 Codex
  • ADB

활용 사례

  • 모바일 앱 자동화 테스트
  • UI 기반 AI 에이전트
  • LLM 성능 벤치마킹
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 07.수집 2026. 04. 07.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.