본문으로 건너뛰기

실제 모바일 환경을 위한 네이티브 멀티모달 GUI 에이전트 Xiaomi-GUI-0

기존 GUI 에이전트 연구는 주로 시뮬레이션과 오프라인 궤적에 의존하여 실제 앱 레이아웃과 비정상 상태 분포를 제대로 반영하지 못했다. 본 논문은 물리적 장치를 주 실행 환경으로 삼는 닫힌 루프 혼합 인프라를 통해 훈련·평가 분포를 실제 배포 환경에 가깝게 맞추었다. 이 접근은 권한 대화상자, 결제 인증 등 실제 환경에서 잦은 상태 변화를 다루는 에이전트의 실행 안정성과 복구 능력을 본질적으로 개선하는 방향으로 의미를 가진다.

용어 해설

실기기 닫힌 루프(Real-device Closed Loop)
실제 물리적 장치를 주 실행 환경으로 삼아 데이터 수집·학습·평가를 동일한 실행 분포에서 반복하는 방식으로, 시뮬레이터 편향을 줄이고 실제 배포 환경에서의 상태 분포(권한 대화상자, 결제 인증 등)를 반영하여 에이전트의 수행 안정성을 높이는 데 중요하다.
데이터 플라이휠(Data Flywheel)
실행 실패 궤적을 교정 행동, 반성적 설명, 복구 시연 등으로 자동 변환하여 재학습에 투입함으로써 실패로부터 점진적으로 능력을 개선시키는 반복적 데이터 증식·갱신 메커니즘이다.
에이전틱 강화학습(Agentic Reinforcement Learning)
단계별 행동 선택과 고차원적 계획·회복 능력을 포함하여 에이전트 수준의 연속적 의사결정을 학습시키는 강화학습 방식으로, 단일 행동의 보상뿐 아니라 장기 목표 달성과 실패 복구를 고려하도록 정책을 갱신한다.
스텝 레벨 강화학습(Step-level Reinforcement Learning)
각 인터페이스 조작 스텝(탭, 스와이프, 텍스트 입력 등)을 별도의 행동 단위로 정의하고 그 보상 신호로 정책을 학습시켜 장기적 작업 성공률을 높이는 세부 행동 중심의 RL 접근법이다.
지도학습 파인튜닝(Supervised Fine-tuning)
사전수집된 다중 출처 행동-상태 데이터로 모델의 행동 출력을 지도학습 방식으로 미세조정하여 초기 정책을 형성하고 이후 강화학습 단계의 안정적 수렴을 돕는 방법이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.