TL;DR
현행 GUI 벤치마크가 정적 스크린샷에 의존하는 반면, OmniGUI는 이미지/오디오/비디오를 매 단계 입력으로 제공한다. 이를 통해 시나리오별 시간적·음향적 맥락이 행동 결정에 미치는 영향을 정량적으로 평가할 수 있다.
왜 중요한가
현행 GUI 벤치마크가 정적 스크린샷에 의존하는 반면, OmniGUI는 이미지/오디오/비디오를 매 단계 입력으로 제공한다. 이를 통해 시나리오별 시간적·음향적 맥락이 행동 결정에 미치는 영향을 정량적으로 평가할 수 있다.
핵심 기여
Step-level omni-modal GUI benchmark
709 에피소드, 2,579 스텝, 29개 애플리케이션으로 구성되며, 매 단계 입력으로 이미지/오디오/비디오를 제공하고 AV-Critical/AV-Supportive/AV-Present의 의존성 수준으로 멀티모달 정보를 공식화한다.
Standardized baselines with omni-modal models
Gemini 3.0 Pro 등 다수의 omni-modal 모델을 에이전트 프록시로 사용하고, 고정된 프롬프트 템플릿과Deterministic inference 파이프라인으로 평가를 수행한다.
Ablation reveals cross-modal interference
비시각 신호가 타깃 환경에서 예측에 미치는 영향과 AV-Present에서의 모달리티 제거 효과를 실험적으로 확인한다.
Dataset release and evaluation pipeline
709 에피소드의 메타데이터와 step-level 실행 추적 데이터를 포함하는 데이터셋 및 평가 파이프라인, 프롬프트 템플릿을 제공한다.
핵심 아이디어 이해하기
이 논문은 GUI 에이전트의 평가를 위해 시각 입력뿐만 아니라 오디오 및 비디오를 매 단계의 관찰(St)로 제공하는 절차를 도입한다. 관찰 St는 It, Vt, At, Ht로 구성되며, 실행 가능한 액션 at을 예측하는 것이 목표다. 좌표 기반의 TAP/DES 등 13개의 원시 동작과 좌표를 포함하는 파라미터를 다룬다. Observation St = (It, Vt, At, Ht)에서 It는 현재 스크린의 정지 이미지, Vt는 시간적 비디오 클립, At는 동시 오디오, Ht는 과거 액션 히스토리이다. 좌표는 [0, 1000] 범위의 정규화 좌표를 사용한다. 액션 공간 A는 13가지 원시를 포함하며, NONE, TAP, DOUBLE_TAP, LONG_PRESS, SWIPE_UP/LEFT/RIGHT/DOWN, INPUT, BACK, HOME, TASK_COMPLETE, TASK_IMPOSSIBLE 등이 있다. 이 구조는 step-level로 인지-행동 연결의 정확도를 평가하도록 설계되었다. 연구는 AV-Critical의 비시각적 정보 의존도 증가에 따른 성능 저하를 실험적으로 확인하고, AV-Present에서의 영향은 작지 않음을 관찰한다.
방법론
- Unified prompt 템플릿과 deterministic greedy decoding으로 실험을 수행한다. 2) St = (It, Vt, At, Ht)에서 It는 현재 스크린 이미지, Vt는 시간적 비디오, At는 동시 오디오, Ht는 과거 액션 히스토리이다. 3) Action Space는 13개의 원시와 좌표/텍스트 파라미터를 포함하며 좌표 범주는 [0, 1000]이다. 4) 데이터 수집은 709 에피소드, 2,579 스텝, 29개 앱으로, 이중언어 task_description이 제공된다. 5) TM/EM/SR/GP를 평가 지표로 사용하며, step-level teacher-forcing 프로토콜을 적용한다. 6) 프로토콜은 offline 벤치마크이며, 고정 데이터로 평가한다.
관련 Figure

Fig 1은 단계별 입력과 행동 예측의 흐름을 시각화하고 TM/EM를 제시한다. 이는 per-step 멀티모달 인식-액션 매핑의 핵심 아이디어를 설명한다.
OmniGUI 벤치마크 개요 다이어그램

Fig 2는 709에피소드, 2,579 스텝, 29 앱의 분포를 보여주며, 애플리케이션 및 언어 분포와 멀티모달 의존성 레벨 분포를 함께 제시한다.
데이터셋 통계 도표
주요 결과
- Gemini 3.0 Pro의 EM은 66.4%, SR은 33.1%이다. 2) Qwen3-Omni는 EM 33.4%, SR 5.2%로 오픈소스 모델 간 격차가 크게 나타난다. 3) AV-Critical에서 No AV 시 EM이 10.5포인트 감소하는 등 비시각 정보의 중요성을 확인한다. 4) Auditory Neglect 및 Spatial Grounding Failure 등 오류 패턴이 제시된다.
관련 Figure

Fig 3은 Auditory Neglect와 Spatial Grounding Failure의 사례를 제시해 멀티모달 인식의 한계와 좌표 예측의 도전을 강조한다.
오류 분석 예시: Auditory Neglect 및 Spatial Grounding Failure

Fig 4는 5개 Task Dimension과 3 Dependency Level에서 모델의 EM 차이를 다차원적으로 비교한다.
Capability fingerprints: EM 기반 다차원 비교
기술 상세
A-layer: 연구자용 기술 상세
- St = (It, Vt, At, Ht)로 정의되며 It는 현재 스크린 이미지, Vt는 시간적 비디오 클립, At는 환경 오디오, Ht는 과거 실행 이력이다. 좌표는 [0,1000]의 정규화된 공간을 사용한다. - Action Space는 13개의 원시(예: TAP, SWIPE_UP, INPUT, BACK, HOME, TASK_COMPLETE 등)와 좌표/텍스트 파라미터를 포함한다. - 프롬프트 템플릿은 시스템 프롬프트와 사용자 메시지 두 부분으로 구성되며, 출력은 단일 JSON 객체를 따른다. - 데이터 수집은 709 에피소드, 2,579 스텝, 29개 애플리케이션으로 구성되며, 이중언어(task_description)가 제공된다. - 실험에 사용된 모델로는 Gemini 3.0 Pro, Gemini 3.0 Flash, Gemini 2.5 Pro/Flash, Qwen3-Omni, MiniCPM-o, VITA-1.5, Baichuan-Omni-1.5 등 8개가 있다.
실무 활용
다중 모달 입력에 따른 GUI 에이전트의 현실적 운용 가능성을 평가하고 비교하는 표준을 제시한다.
- 멀티모달 입력을 필요로 하는 모바일 GUI 자동화 연구
- 환경 소리와 영상이 의사결정에 영향을 주는 시스템 개발
- 에이전트의 안정성 분석 및 로버스트성 평가
- 다중 모달 파이프라인의 비용/효율성 최적화
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- AV-Critical
- — AV-Critical은 오디오 또는 영상의 특정 시점에서 정답 수행에 결정적 정보를 필요로 하는 태스크를 뜻한다. 정적 스크린샷만으로는 다음 행동을 정확히 예측하기 어려워, 비시각적 정보의 결합이 필수적이다.
- AV-Supportive
- — AV-Supportive는 비시각적 신호가 판단에 보조적으로 기여하나 필수는 아니고, 비주류 신호가 해석을 보강한다.
- AV-Present
- — AV-Present는 멀티모달 신호가 존재하더라도 정적 UI 정보만으로 대부분의 단계가 해결되는 상태를 뜻한다.
- Temporal Reasoning
- — Temporal Reasoning은 UI의 시간적 변화나 이벤트 순서를 추적하고 해석하는 능력이다.
- Cross-modal Interference
- — Cross-modal Interference는 서로 다른 모달리티 간의 정보가 서로 간섭해 의도된 행동 예측을 방해하는 현상이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.