TL;DR
앱 생태계가 방대하고 자주 변경되어 인간 라벨로 적응하기 어렵다. MobileForge는 사람 라벨 없이 대상 앱 상호작용으로부터 태스크와 계층적 피드백을 자동 생성해 에이전트를 효과적으로 적응시켜, 폐쇄 데이터 기반 GUI 모델과 근접한 성능을 보인다.
왜 중요한가
앱 생태계가 방대하고 자주 변경되어 인간 라벨로 적응하기 어렵다. MobileForge는 사람 라벨 없이 대상 앱 상호작용으로부터 태스크와 계층적 피드백을 자동 생성해 에이전트를 효과적으로 적응시켜, 폐쇄 데이터 기반 GUI 모델과 근접한 성능을 보인다.
핵심 기여
MobileGym: 대상앱 기반 무주석 적응 서브스트레이트
대상 앱을 함수 수준 구조와 스크린샷으로 탐색해 실행 가능한 태스크 커리큘럼을 채굴하고, 완료 여부(z), 단계별 과정 라벨(ℓ), 교정 힌트(h)를 출력하는 MobileGym-Critic으로 롤아웃 평가를 산출한다. 모든 산출물은 실제 앱 상호작용에 근거한다.
HiFPO: 힌트-컨텍스트화된 단계별 GRPO 학습 루프
K번 다중 시도 롤아웃으로 힌트를 누적하고, 성공률 기반 필터링과 단계 수준의 합리성(reasonable-step) 선택으로 학습 데이터 𝒟를 구성한 뒤, 힌트가 포함된 단계 프롬프트에서 그룹 상대 GRPO를 적용해 정책을 갱신한다.
계층적 피드백의 단계·궤적 분해와 재사용 규칙
모든-성공(SR(x)=1) 태스크는 제거하고, 실패·부분성공 태스크는 유지해 성공하지 못한 시도에서도 합리적 단계들을 추출한다. 이 규칙이 학습 안정성과 개선에 기여한다.
실험적 성과: 공개 데이터로 GPU 8대 학습 시 대규모 성능 향상
Qwen3-VL-8B에 무주석 적응을 적용하면 AndroidWorld에서 Pass@3 67.2%를 달성해 GUI-Owl-1.5-8B(69.0%)에 근접했고, ForgeOwl-8B는 AndroidWorld Pass@3 77.6% 및 MobileWorld GUI-only success 41.0%를 기록했다.
핵심 아이디어 이해하기
문제 출발점: 모바일 GUI 제어는 순차적 의사결정 문제로, 환경이 밀집된 스크린과 상호작용 히스토리를 제공하지만 환경 보상은 희박하다. 이때 단일 롤아웃을 독립 경험으로 처리하면 긴 궤적의 일부 성공 정보를 학습에 재사용하지 못하고 sparse reward로 인해 정책 개선이 느려진다.
해결 원리: MobileForge는 앱 탐색으로 얻은 실제 전이(transition) 증거를 바탕으로 실행 가능한 태스크 집합을 생성하고, 각 시도(rollout)에 대해 세 수준의 계층적 피드백(z, ℓ, h)을 만든다. 이 피드백은 (1) 태스크 단위 성공/실패 결정, (2) 단계별 합리성 태그와 근거 텍스트, (3) 실패 요약과 교정 힌트로 구성된다. 힌트는 이후 시도 프롬프트에 입력으로 포함되어 정책의 행동 선택을 조건화한다.
학습 신호 변환: HiFPO는 같은 태스크를 K번 시도해 힌트를 누적하고, 성공률 SR(x)=1인 태스크는 제거해 이미 마스터된 동작을 배제한다. 나머지 태스크에서 가장 '합리적' 비율 Q_k(=합리적 단계 수/총 단계 수)가 높은 시도를 선택해 단계 단위의 (s,a) 쌍을 구성한다. 단계별 학습은 그룹 상대 최적화(GRPO)를 사용하되, 각 그룹을 힌트로 조건화한 상태 tilde{s}로 정의해 '같은 교정 정보' 하에서 여러 후보 응답을 비교·정규화해 우수 행동을 강화한다.
결과적 변화: 이 접근은 long-horizon 문제를 단계 수준의 조밀한 신호로 변환하고, 힌트로 조건화된 그룹 비교를 통해 잘못된 전체 롤아웃을 그대로 강화하지 않으면서도 실패에서 유용한 부분 정보를 회수해 정책을 의미 있게 개선한다.
방법론
전체 파이프라인 개요: MobileForge는 MobileGym(탐색·커리큘럼·크리틱)과 HiFPO(다중 시도 롤아웃·필터링·GRPO)로 구성된다. 입력으로 대상 앱 집합과 초기 GUI 정책 π_θ가 주어지면, MobileGym이 전이 기록 𝒵를 수집하고 MobileGym-Curriculum이 이를 실행 가능한 태스크 𝒯로 변환한다. 이후 HiFPO가 각 태스크에 대해 K번 롤아웃을 실행해 계층적 피드백 ℱ_k=(z_k,{ℓ_k^{(t)}},h_k)를 얻는다.
핵심 메커니즘 — 피드백 생성과 활용: MobileGym-Critic는 각 완료된 롤아웃 로그를 시각화한 단계별 스냅샷과 VLM 기반 설명을 만들어, 최종 의사결정 모델이 z_k(성공/실패), 단계별 v_k^{(t)}(합리성), e_k^{(t)}(설명), h_k(교정 힌트)를 반환한다. 힌트는 다음 시도에서 태스크 지시어에 누적되어 프롬프트에 삽입된다. 이 입력은 단계별 상태 s^{(t)}=(x,I^{(t)},ℋ^{(t)},η)에서 η를 통해 전달된다.
데이터 필터링·선별: 각 태스크의 경험은 SR(x)=1인 경우 제거된다; SR(x)=0 또는 0<SR(x)<1인 태스크는 유지된다. 각 유지 태스크에 대해 Q_k(합리적 단계 비율)를 계산하고, 성공 시 가장 높은 Q_k를 보인 성공적 시도 또는 실패만 존재하면 Q_k 최댓값 시도를 선택한다. 선택된 시도에서 χ^{(t)}=𝟙[v^{(t)}=1]인 단계만 학습 집합 𝒟에 포함된다.
GRPO 기반 학습: 각 학습 샘플 d_j=(s_j,a_j^*)에서 s_j는 힌트 η_j를 포함한 상태로 프롬프트 tilde{s}j로 변환된다. 기존 정책에서 G개의 후보 응답을 샘플한 뒤 각 응답을 파싱해 행동 보상 R{j,g}을 계산한다. 보상은 행동 유형 일치 r^{type}와 인자 유사도 r^{arg}의 가중합으로 구성된다. 그룹 평균 μ_j과 표준편차 σ_j로 정규화해 A_{j,g}=(R_{j,g}-μ_j)/(σ_j+ε) 를 구하고, 클리핑된 중요도 비율과 KL 정규화를 포함한 GRPO 손실로 θ를 갱신한다.
관련 Figure

파이프라인 단계별 입력·출력(𝒵→𝒯→{τ_k}→ℱ→𝒟→θ') 흐름을 명확히 보여, 각 구성요소가 어떤 데이터를 생성·소비하는지와 역할 분리를 이해하는 데 중요한 근거를 제공한다.
MobileGym(탐색·커리큘럼·롤아웃·크리틱)과 HiFPO(다중 시도·필터링·GRPO)의 전체 파이프라인 다이어그램.

각 서브모듈이 생성하는 데이터 스키마(x=(ι,B,c,v,p), ℱ_k=(z_k,{ℓ_k^{(t)}},h_k))와 흐름을 구체적으로 보여 MobileGym이 무주석 적응의 근간임을 명확히 한다.
MobileGym 내부 구조: Target-App Exploration, MobileGym-Curriculum, MobileGym-Critic와 산출물(탐색 증거·태스크·계층적 피드백).
주요 결과
주요 벤치마크 성과: AndroidWorld(116 tasks) 인-도메인에서 Qwen3-VL-8B가 MobileForge로 적응되어 Pass@3 67.2%에 도달해 GUI-Owl-1.5-8B(69.0%)에 근접했다. GUI-Owl-1.5-8B 기반의 ForgeOwl-8B는 AndroidWorld에서 Pass@3 77.6%를 기록했다(표 1).
도메인 외 전이: MobileWorld GUI-only(117 tasks)에서 ForgeOwl-8B는 success rate 41.0%를 달성해 공개 데이터 기반 에이전트 중 최고 성능을 보였다(표 2). ForgeQwen3-8B는 같은 적응 데이터로 10.3%를 기록했다.
절차적·학습적 검증: 힌트 제거 실험에서 corrective hints 포함 시 전체 성공률이 52.0%→77.0%로 +25.0pp 향상했고(Pass@3 49.0%→72.5%), 힌트-조건화 GRPO는 동일 데이터에서 SFT 대비 더 높은 성능을 보였다(예: 900-task에서 Pass@1 50.9% vs 힌트 SFT 47.4%).
효율성·학습 규모: MobileForge가 생성한 AndroidWorld-side 후보 태스크는 3,249개, 주 실험은 200/400/900 태스크 서브셋을 사용했다. 900-task 8B 학습은 NVIDIA 80GB GPU 8대에서 약 80시간 소요됐다.
관련 Figure

시스템 구성( MobileGym + HiFPO )과 성능 비교를 시각적으로 집약해 논문의 전반적 기여와 결과를 한눈에 확인하게 한다. MobileForge의 무주석 적응이 Qwen3-VL-8B와 GUI-Owl 기반 모델 성능을 크게 향상시킨 점을 강조한다.
MobileForge 개요와 주요 성과(AndroidWorld Pass@3, MobileWorld success)를 요약한 티저 그림.

힌트가 단순 메타데이터가 아니라 다음 시도의 행동 조건으로 직접 삽입되어 문제 반복을 줄이고 성공률을 높이는 작동 경로를 사례 수준에서 입증한다. 힌트 포함/미포함 비교 실험의 직관적 근거가 된다.
힌트의 역할을 보여주는 사례: 실패 시 교정 힌트 생성과 이를 다음 시도에 반영해 성공으로 이끄는 예시 스크린샷 시퀀스.

베이스 모델이 흐름을 잃는 사례와 MobileForge로 적응된 모델이 반복 항목 삭제 플로우를 유지해 완수하는 변화를 시각적으로 보여 정량 결과(성공률 향상)의 질적 근거를 제공한다.
AndroidWorld의 ExpenseDeleteMultiple2 태스크에 대한 베이스 모델과 적응된 모델의 비교 궤적(성공/실패 흐름).

적응으로 큰 개선이 일어난 태스크군(verification, search, screen reading 등)과 여전히 어려운 영역(game, multi-app 등)을 한눈에 보여 연구의 강점과 한계를 정량적으로 보강한다.
태스크 태그별 실패율 감소 히트맵: 적응 전후의 실패율 차이를 태스크 유형별로 시각화.
기술 상세
아키텍처 구조: 시스템은 MobileGym(어플리케이션 탐색기, MobileGym-Curriculum, MobileGym-Critic)과 HiFPO(다중 시도 롤아웃, 태스크 필터링, 단계 선택, 힌트-조건화 GRPO)로 분리되어 구성된다. MobileGym-Critic는 VLM 기반 단계 설명과 최종 결정 모델을 결합해 ℱ_k를 생성한다.
수치화·보상 설계: 각 단계 응답에 대해 먼저 파싱 성공 여부를 확인한다(실패 응답은 보상 0). 파싱 성공 시 행동 유형 일치 여부 r^{type}=𝟙[α̂=α*]를 계산하고, 유형 일치 시 인자 유사도 S_{α*}(ψ̂,ψ*)∈[0,1]으로 r^{arg} 산출한다. 최종 보상 R_{j,g}=λ_{type}r^{type}+λ_{arg}r^{arg}이다. 그룹 평균 μ_j과 표준편차 σ_j로 정규화해 A_{j,g}=(R_{j,g}-μ_j)/(σ_j+ε) 를 얻고, 클립된 중요도 비율과 함께 GRPO 손실 ℒ_{HiFPO}로 파라미터를 갱신한다. 손실에는 KL(π_θ(·|s̃_j) || π_ref(·|s̃_j)) 정규화 항도 포함된다.
알고리즘 차별점: 기존 단계 수준 SFT나 단일 롤아웃 기반 RL과 달리 HiFPO는 (1) 다중 시도에서 힌트 누적을 통해 상태를 조건화하고, (2) 태스크별 SR 필터링으로 이미 마스터된 태스크를 제거해 오버리턴을 방지하며, (3) 실패에서 유용한 합리적 단계만 추출해 단계 단위로 GRPO 학습을 수행한다.
구현·학습 세부사항: 평가 실험은 Qwen3-VL-8B와 GUI-Owl-1.5-8B를 베이스로 하며, 생성된 AndroidWorld-side 후보 태스크 3,249개 중 200/400/900 개 서브셋으로 스케일 실험을 수행했다. 900-task 8B 실험은 8×80GB GPU에서 약 80시간이 소요됐다. MobileGym-Critic의 최종 결정 모델은 여러 대체(decision models)로 실험해 성능 영향을 측정했다.
관련 Figure

힌트 누적(η_{<k}), 성공률 기반 필터(SR(x)), 합리적 단계 선택(Q_k)과 GRPO 손실 구성(그룹 정규화·클리핑·KL 정규화)을 시각적으로 연결해 학습 부분의 핵심 처리를 보강한다.
HiFPO의 처리 흐름: 다중 시도 롤아웃 → 태스크 필터링 → 단계 선택 → 힌트-컨텍스추얼 GRPO 업데이트.
한계점
적응 범위는 탐색한 앱 생태계에 의해 제한된다(논문에서 AndroidWorld 중심). 멀티앱 장기 워크플로우, 지속적 사용자 상태, 비표준 규칙·게임 등은 여전히 어려움으로 남는다. 자동 평가기(critic) 품질에 의존하므로 평가기 성능이 낮으면 학습 신호가 잡음화될 위험이 있다.
실무 활용
MobileForge는 실제 앱에서 자동으로 태스크와 계층적 피드백을 수집해 LLM/VLM 기반 GUI 정책을 무주석으로 적응시킨다. GitHub에 코드와 데이터가 공개되어 있어 재현 및 도메인 확장 실험에 직접 활용 가능하다.
- 모바일 테스트 자동화 에이전트 적응: 앱 업데이트가 잦은 서비스에서 인간 라벨 없이 정책을 재학습해 회귀 테스트 워크플로우를 보강
- 앱별 튜토리얼·온보딩 자동화: 실제 앱 상호작용으로부터 유저 플로우를 추출하고 에이전트를 튜닝해 반복적 UI 작업 자동화
- 멀티앱 워크플로우 연구용 데이터셋 생성: MobileGym 탐색으로 얻은 전이 기록을 분석해 복합 기능 커버리지 확보
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Annotation-Free
- — 사람이 만든 태스크·데모·보상 라벨 없이 에이전트를 대상 앱 상호작용으로부터 자동으로 적응시키는 방법. 탐색→커리큘럼 생성→롤아웃→평가 피드백을 순환하여 지도 신호를 얻는다.
- Hierarchical Feedback
- — 완료 여부(outcome), 단계별 과정 라벨(process), 실패 시 교정 힌트(hint)를 포함하는 구조화된 피드백. 긴 행위(trajectory)를 단계별 재사용 가능한 신호로 분해하여 학습에 활용한다.
- Hint-Contextualized Training
- — 이전 시도에서 생성된 교정 힌트를 다음 시도의 프롬프트에 포함하여 정책이 같은 상태에서 다양한 후보 행동을 비교·학습하도록 만드는 전략. 그룹 상대 보상 계산과 결합한다.
- Multi-Attempt Rollout
- — 같은 생성 태스크를 K번 연속 시도하여 이전 시도의 힌트를 누적하고, 성공률·과정 품질에 따라 태스크를 걸러 학습 데이터를 구성하는 수집 프로토콜.
- Group-Relative Optimization (GRPO)
- — 같은 프롬프트(그룹)에 대해 샘플된 여러 응답의 보상을 정규화·비교하여 상대적 우수 행동을 학습하는 방법. 본 논문에서는 힌트로 조건화된 단계별 그룹을 사용한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.