본문으로 건너뛰기

ScaleWoB: 대규모 환경 합성을 통한 GUI 에이전트 지침

ScaleWoB는 GUI 에이전트 평가와 학습을 위한 백엔드-프리 URL 기반 환경과 자동 보상 검증기를 제공한다. 이를 통해 대규모 태스크와 플랫폼 간 벤치마크를 가능하게 하며, 실험에서 현재 에이전트의 평균 SR은 27.92%로 인간 92.08%와의 큰 차이를 보였다. 이 격차는 장기 상호작용과 정교한 제어 능력의 개선 여지가 큼을 시사한다.

왜 중요한가

ScaleWoB는 GUI 에이전트 평가와 학습을 위한 백엔드-프리 URL 기반 환경과 자동 보상 검증기를 제공한다. 이를 통해 대규모 태스크와 플랫폼 간 벤치마크를 가능하게 하며, 실험에서 현재 에이전트의 평균 SR은 27.92%로 인간 92.08%와의 큰 차이를 보였다. 이 격차는 장기 상호작용과 정교한 제어 능력의 개선 여지가 큼을 시사한다.

핵심 기여

ScaleWoB 프레임워크로 GUI 환경 및 보상 검증기 자동 합성

자연어 태스크를 입력으로 받아 PRD 설계, 페이지 구조/데이터 스키마/상호작용 로직 구현, 자동으로 실행 가능한 reward validator를 포함하는 최소 작동 환경(MWE)을 생성하고, 태스크 solvability를 검증하는 루프를 운영한다.

완전 합성 모바일 GUI 벤치마크 구성

63개 앱, 120개 태스크를 포함하는 모바일 GUI 에이전트 벤치마크를 구성하고 각 태스크에 대해 자동 생성된 보상 검증기를 제공한다.

다단계 환경 합성 및 인간-루프 품질 관리

Stage 1에서 앱 로직/데이터를 구성하고 Stage 2에서 태스크 주입 및 보상 검증기를 합성한다. 인간-in-the-loop를 통해 문제를 진단하고 재생성한다.

플랫폼-중립적 파이프라인 및 확장성

모바일, 데스크톱, IVI 등 다양한 GUI 포맷에 동일 파이프라인을 적용할 수 있도록 URL-기반의 환경을 제공한다.

실험 분석으로 한계와 개선 방향 제시

다양한 모바일 GUI 에이전트를 비교 분석해 긴 호라이즌 태스크에서의 한계(메모리·탐색·정밀 컨트롤)를 식별하고 향후 연구 방향을 제시한다.

핵심 아이디어 이해하기

단락 1 출발점: GUI 에이전트의 평가와 훈련은 현실 앱의 상태 추적과 보상 설계의 난이도로 인해 비용이 크고 재현성이 떨어진다. 시나리오 간의 상태 차이와 다중 단계 상호작용에서의 기억 관리가 핵심 도전과제이다. 단락 2 해결 원리: ScaleWoB는 환경 합성을 코드 생성의 문제로 다루며, Stage 1에서 PRD를 바탕으로 Minimal Working Environment(MWE)을 반복적으로 구축하고, Stage 2에서 태스크 주입과 보상 검증기를 합성한다. 보상 검증은 로컬 스토리지 기반의 상태 관리로 정확하게 판단되어 패스/실패를 명확히 구분한다. 단락 3 달라지는 점: 파이프라인은 플랫폼-중립적이며 URL로 접근되는 백엔드-프리 웹페이지를 통해 모바일/데스크톱/IVI에 걸쳐 재현성과 확장성을 확보한다. 또한 태스크는 간단한 조작부터 긴 호라이즌/수학적 요구를 포함하도록 구성되어 에이전트의 다양한 능력을 구분한다. 단락 4 결과 요약: 120개 태스크, 63개 앱, 5개 모델의 SR은 평균 27.92%로 인간(92.08%)에 크게 못 미치지만, 시나리오 다양성과 긴 호라이즌 태스크에 대한 강력한 차별화 능력을 보여준다. 이로써 GUI 에이전트 연구의 방향성과 한계점을 구체적으로 제시한다.

방법론

단락 1 전체 접근 방식: ScaleWoB는 환경 합성을 코드 생성으로 해결하는 프레임워크로, 모바일 GUI의 실행 가능한 웹페이지를 백엔드 없이 생성하고 각 태스크에 대해 보상 검증기를 함께 제공한다. 입력으로 주어지는 태스크 기술서와 스크린샷은 PRD를 통해 페이지 구조와 데이터 스키마, 상호작용 로직으로 변환된다. 패턴은 입력 → PRD 설계 → 페이지/데이터 로직 구현 → Self-Reflection으로 품질 점검 → 다음 반복으로 개선이다. 단락 2 핵심 메커니즘: Stage 1에서 앱 메타데이터를 수집하고 코드생성 LLM이 PRD를 작성한 뒤 페이지 구조, 데이터 스키마, 인터랙션 로직을 구현하고, Self-Reflection로 일관성을 점검한다. Stage 2에서 데이터 내용을 확장하고 태스크 명세를 제공해 태스크-관련 로직을 수정하며, 실행 가능한 보상 검증기를 합성한다. 이때 로컬 스토리지로 상태를 관리하고, 재설정은 window.reset으로 가능하게 한다. 단락 3 학습/구현 세부: 환경은 100% URL-접근 가능한 웹페이지이며, 초기 MWE를 바탕으로 태스크를 삽입하고 검증기를 자동 합성한다. 태스크는 비동일 경로를 피하기 위해 같은 앱 컨텍스트에서 관련 태스크를 함께 생성한다. 단락 4 품질 관리: 자동 검증에서 실패한 경우 인공 지능/사람-전문가가 원인을 진단하고 재생성 루프에 복귀시켜 번들을 후보 풀에 올리는 절차를 거친다. 인간 확인과 무작위 품질 검사를 추가로 수행한다.

관련 Figure

ScaleWoB의 두 단계 합성 파이프라인을 요약한 다이어그램으로 SimuWoB 가상 앱과 Mobile GUI Agent 간의 상호작용 흐름을 보여준다.
Diagram

Stage 1의 Minimal Working Environment(MWE)과 Stage 2의 Task Injection 및 Reward Validator가 서로 연결되어 전체 파이프라인의 흐름을 시각화한다.

ScaleWoB의 두 단계 합성 파이프라인을 요약한 다이어그램으로 SimuWoB 가상 앱과 Mobile GUI Agent 간의 상호작용 흐름을 보여준다.

ScaleWoB의 파이프라인 구성 요소를 보여주는 아키텍처 다이어그램으로 PRD 생성, 페이지 구조, 데이터 엔티티, 보상 검증기가 포함된다.
Diagram

PRD 기반의 설계 흐름과 환경-생성 사이의 상호작용을 설명하며, 자동 합성의 구체적 구성 요소를 시각적으로 확인할 수 있다.

ScaleWoB의 파이프라인 구성 요소를 보여주는 아키텍처 다이어그램으로 PRD 생성, 페이지 구조, 데이터 엔티티, 보상 검증기가 포함된다.

window.getTasks/window.evaluateTask와 관련된 코드 스니펫으로 태스크 정의와 평가 로직을 보여준다.
Screenshot

환경 API의 태스크 정의와 평가 절차를 구체적으로 제시하며, 자동화된 태스크 평가의 구현 디테일을 확인할 수 있다.

window.getTasks/window.evaluateTask와 관련된 코드 스니펫으로 태스크 정의와 평가 로직을 보여준다.

주요 결과

메인 벤치마크 결과: SR은 Seed-1.8이 42.50%(±7.07), Gemini가 38.75%(±0.59), UI-TARS-1.5가 29.58%(±2.95), GUI-Owl-1.5가 9.17%(±2.35), MAI-UI가 19.58%(±0.59)로 나타났다. SR(returns)은 Seed-1.8 30.43%(±9.22), Gemini 28.26%(±3.07), UI-TARS 13.04%(±0), GUI-Owl 0%(해당 없음), MAI-UI 0%(해당 없음)이며 SR(AW)은 70.7, 69.7, 64.2, 71.6, 70.7로 보고된다. 평균 SR은 27.92%(±0.0)로 나타났고, SR(with returns) 23.91%(±0.0), SR(without returns) 36.35%(±0.0)이다. 사람 점수는 전체 92.08%(±0.59)로 나타났으며, with returns 85.87%(±1.54), without returns 95.95%(±1.92)이다. 벤치마크의 카테고리별 SR은 간단(simp.) 40.00, 장기(long.) 17.82, 수학(math.) 19.09로 요약된다. 또한 Real-World Sample Task에서의 20개 태스크는 실제 모바일 환경에서의 결과와 경향이 일관되며, ScaleWoB의 평가가 실제 앱에 일반화될 수 있음을 시사한다. 이 밖에 8개의 병렬 워커로 실행 가능하며, 실험은 8개 병렬 워커로 수행되었다. 실험은 대략적인 방향성과 한계점을 제시하며, 실험 결과는 4.2 및 4.3에 자세히 제시되어 있다.

관련 Figure

ScaleWoB의 실험 결과를 요약한 막대그래프로 Seed/UI-TARS/GUIOwl/MAI-UI/Gemini의 SR를 비교한다.
Chart

플랫폼 간 모델 간 성능 차이가 명확하며, 평균 SR 27.92%와 인간 92.08%의 차이가 벤치마크의 강력한 차별화 능력을 보여준다.

ScaleWoB의 실험 결과를 요약한 막대그래프로 Seed/UI-TARS/GUIOwl/MAI-UI/Gemini의 SR를 비교한다.

카테고리별 SR를 보여주는 그림으로 Simple/Long-horizon/Math 카테고리의 성능 분포를 제시한다.
Chart

특히 Long-horizon과 Math 카테고리에서 에이전트의 성능 저하가 두드러지며, 장기 기억과 탐색 전략의 중요성을 시사한다.

카테고리별 SR를 보여주는 그림으로 Simple/Long-horizon/Math 카테고리의 성능 분포를 제시한다.

기술 상세

다음은 ScaleWoB의 핵심 구조에 대한 기술적 요지이다. 시스템은 PRD 설계로 시작해 페이지 구조, 데이터 스키마, 인터랙션 로직을 점진적으로 구현한다. Stage 1에서 MWE를 확보한 뒤 Stage 2에서 태스크 요구사항을 주입하고 보상 검증기를 합성한다. 보상 검증기는 태스크의 성공 조건을 정확히 검사해 재현 가능한 점수를 산출하며, localStorage를 이용해 상태를 지속적으로 관리한다. 환경은 100% URL-접근 가능한 웹페이지로 구현되며, reset은 window.reset를 통해 상태를 초기화한다. 또한 Validation Agent가 각 번들을 실행해 실패 사례를 인간 전문가가 진단하고 필요 시 재생성하는 Repair Loop를 수행한다. 벤치마크는 8-16명의 동시 작업자 동시 실행을 지원하도록 설계되었고, 플랫폼 확장을 염두에 두고 모바일/데스크톱/IVI 프로파일을 동일 파이프라인으로 다룬다.

한계점

Observation 공간은 시각적 관측 및 DOM 수준 API에 한정되며 네이티브 플랫폼의 고급 신호(Accessibility 트리 등)는 제공되지 않는다. 현재 다앱 간 협업 작업은 다루지 않으며 벤치마크의 확대는 향후 연구 과제다. 모바일에 집중된 벤치마크로, 데스크톱/IVI에 대한 대규모 정량적 벤치마크 확장은 추후 작업이다. 학습 검증은 이 논문에서 주된 평가에 국한되며, Downstream 학습 효율성 향상은 추가 연구가 필요하다.

실무 활용

ScaleWoB는 GUI 에이전트의 평가 및 학습에 실용적으로 활용될 수 있는 백엔드-프리 URL 기반의 환경과 보상 시스템을 제공한다. 플랫폼에 독립적이며, 대규모 태스크 셋과 다양한 언어/도메인 구성을 지원한다.

  • GUI 에이전트의 성능 벤치마크 및 비교 연구
  • 온라인 RL 기반 GUI 에이전트 훈련의 샘플링 플랫폼
  • 다중 플랫폼 간 일반화 연구(모바일/데스크톱/IVI)
  • 장기 의사결정 및 기억 관리 특성 분석
  • 툴 사용/탐색 정책의 평가 및 개선

코드 공개 여부: 공개

코드 저장소 보기

키워드

mobile GUI agents(모바일 GUI 에이전트)large language models(대형 언어 모델)synthetic benchmark(합성 벤치마크)virtual environment generation(가상 환경 생성)high-fidelity tasks(고해상도/고충실도 태스크)automatic reward generation(자동 보상 생성)long-horizon interactions(롱 호라이즌 상호작용)agent evaluation(에이전트 평가)

용어 해설

PRD (Product Requirements Document)(PRD)
ScaleWoB 환경의 페이지 흐름, 데이터 구조, 상호작용 로직을 정의하는 설계 문서로, Stage 1의 Minimal Working Environment(MWE) 설계와 Stage 2의 태스크 주입·보상 검증기 설계의 기준이 된다.
최소 작동 환경(Minimal Working Environment)
Stage 1에서 생성되는 실행 가능한 UI 로직과 seed 데이터 엔티티를 포함하는 최소한의 GUI 환경으로, 이후 태스크 주입과 보상 설계의 기초가 된다.
보상 검증기(Reward Validator)
태스크 성공 여부를 결정하는 자동 검증 로직으로, 환경 상태를 재설정해도 일관된 보상을 제공하도록 설계된다.
번들 풀(Bundle Pool)
생성된 앱 번들을 저장하는 저장소로, 품질 검사 및 샘플링 검사를 위한 무작위 품질 관리에 활용된다.
LLM-판정(LLM-as-Judge)
실행 궤적의 채점을 LLM이 주관적으로가 아니라 자동으로 평가하도록 하는 보정 메커니즘의 일종이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 24.수집 2026. 05. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.