본문으로 건너뛰기

GUI 대 CLI: 화면 전용 에이전트와 스킬 매개 에이전트의 실행 병목

소프트웨어를 자동으로 조작하는 에이전트의 실행 능력은 인터페이스 모달리티에 따라 다른 병목을 드러낸다. 동일한 목표와 초기 상태, 동일한 최종 상태 검증을 적용한 통제된 벤치마크를 통해 모달리티 자체가 성능 차이를 유발하는지 분리할 수 있다. 이런 분리는 에이전트 설계에서 모델 개선과 도구 설계 중 어디에 우선 투자해야 하는지를 결정하는 데 직접적인 근거를 제공한다.

왜 중요한가

소프트웨어를 자동으로 조작하는 에이전트의 실행 능력은 인터페이스 모달리티에 따라 다른 병목을 드러낸다. 동일한 목표와 초기 상태, 동일한 최종 상태 검증을 적용한 통제된 벤치마크를 통해 모달리티 자체가 성능 차이를 유발하는지 분리할 수 있다. 이런 분리는 에이전트 설계에서 모델 개선과 도구 설계 중 어디에 우선 투자해야 하는지를 결정하는 데 직접적인 근거를 제공한다.

핵심 기여

매칭된 실행층 벤치마크 구축

저자들은 실행 계층만을 비교하기 위해 440개의 데스크톱 작업을 포함하는 벤치마크를 구성했다. 이 벤치마크는 18개의 애플리케이션과 12개의 워크플로 카테고리를 포괄하며 목표, 초기 상태, 그리고 최종 상태 검증기를 GUI와 CLI 에이전트에게 동일하게 제공했다. 또한 각 에이전트는 자신이 속한 모달리티의 고유 동작만 허용되어 모달리티 간 직접 비교가 가능해졌다.

GUI와 CLI의 통제된 성능 비교

통제된 설정에서 최강 GUI 에이전트는 59.1%의 완전 통과율을 기록했고 최강 원래 스킬 기반 CLI 에이전트는 48.2%를 기록했다. 동일한 검증 기준과 초기 조건을 적용했기 때문에 이 수치들은 모달리티에 기인한 실행 차이를 직접 반영한다. 이 비교는 단순한 모델 성능 비교가 아니라 실행 방식 자체가 성능에 미치는 영향을 밝히는 결과를 제공했다.

스킬 보강이 드러낸 CLI 병목의 본질

검증기 기반의 스킬 보강을 적용하자 CLI 에이전트의 성공률이 69.3%까지 상승했다. 이 결과는 기본 CLI 성능 저하의 많은 부분이 모델 능력 자체보다는 불충분한 스킬 커버리지에서 기인한다는 근거를 제시한다. 따라서 CLI 개선은 모델 튜닝뿐 아니라 스킬 설계와 확장성 문제 해결에 초점을 맞춰야 한다는 시사점을 제공한다.

핵심 아이디어 이해하기

컴퓨터 사용 에이전트는 그래픽 사용자 인터페이스를 직접 조작하는 GUI 방식과 명령형 스킬을 호출하는 CLI 방식으로 소프트웨어를 제어할 수 있다. 기존 연구들은 두 모달리티를 비교할 때 작업 종류, 초기 상태, 검증 기준, 허용된 동작이 서로 달라서 모달리티 자체의 영향과 다른 요인이 혼재되는 문제가 있었다. 본 논문은 이러한 교란 요인을 제거하고 동일한 실행 계층 조건 하에서 모달리티가 초래하는 병목을 직접 관찰하려고 했다.

방법론

연구진은 모달리티별로 동일한 목표와 초기 상태, 동일한 최종 상태 검증기를 제공하는 실행층 벤치마크를 설계했다. 벤치마크는 440개 작업으로 구성되며 18개 애플리케이션과 12개 워크플로 카테고리를 포함해 다양한 실제 데스크톱 시나리오를 포괄한다. 각 에이전트는 자신의 모달리티에 고유한 동작만 사용할 수 있게 제한되어, 모달리티 외의 변인이 실험 결과에 영향을 주지 않도록 통제했다.

주요 결과

주요 결과로 최강 GUI 에이전트가 59.1% 완전 통과율을 기록했고 최강 원래 스킬 기반 CLI 에이전트는 48.2%를 기록했다. 추가 실험에서 검증기 기반으로 스킬을 보강하자 CLI 성공률이 69.3%로 상승하여 기본 CLI 성능 저하의 상당 부분이 스킬 커버리지 부족에서 비롯되었음을 보여줬다. 이 결과는 GUI와 CLI가 각각 다른 실행 병목을 노출한다는 결론으로 이어졌으며 GUI는 장기 워크플로에서의 신뢰성 문제를, CLI는 스킬의 범위와 확장성 문제를 주된 병목으로 드러냈다.

기술 상세

에이전트 분류는 화면 전용 GUI 에이전트와 스킬 매개 CLI 에이전트로 설정되었고 각 에이전트는 모달리티 고유의 동작 집합만 사용하도록 제한되었다. 벤치마크의 각 작업은 명시된 목표 상태와 초기 UI 상태를 가지며 최종 상태를 자동으로 판정하는 verifier가 포함되어 있어서 성공 기준이 객관적으로 통제되었다. 이러한 구조는 상이한 입력 상태나 평가 기준이 결과에 미치는 영향을 제거해 모달리티별 실행 성능을 직접 비교할 수 있게 했다.

한계점

논문은 GUI 에이전트가 장기 워크플로에서 신뢰성 있는 그라운디드 상호작용을 유지하기 어렵다는 점을 지적했다. 또한 CLI 에이전트의 낮은 기본 성공률 대부분이 불충분한 스킬 커버리지에서 발생했다는 사실을 보고했다. 논문은 이러한 발견이 모달리티별 병목을 밝히는 데 유용하다고 결론지었지만 세부적인 스킬 확장 알고리즘이나 GUI 상호작용 개선 기법의 구체적 설계는 추가 연구가 필요하다고 명시했다.

실무 활용

논문에 수록된 벤치마크와 결과는 실제 에이전트 시스템 설계에서 어느 부분에 투자를 우선해야 하는지 판단하는 근거로 활용될 수 있다. GUI 중심 접근은 화면 요소와의 안정적 그라운딩에 집중해야 하며 CLI 중심 접근은 스킬 설계와 자동화된 스킬 확장 메커니즘에 집중해야 한다. 공개된 코드 저장소는 연구 결과를 재현하고 자체 워크플로에 벤치마크를 적용하는 출발점 역할을 한다.

  • 프로덕션용 데스크톱 자동화 에이전트 설계 시 GUI 접근을 선택한다면 화면 내 요소의 장기적 안정성을 개선하는 데 집중할 필요가 있다.
  • 스킬 기반 CLI 에이전트를 도입할 때는 핵심 작업을 커버하는 스킬 라이브러리를 우선 구축하고 검증기 기반 루프를 통해 부족한 스킬을 자동으로 탐지하고 추가하는 워크플로를 마련해야 한다.
  • 연구나 제품 비교를 위해서는 이 논문에서 제공하는 매칭된 실행층 벤치마크를 사용해 동일한 목표와 검증 기준으로 서로 다른 모달리티를 평가해야 정확한 병목 분석이 가능하다

코드 공개 여부: 공개

코드 저장소 보기

키워드

agent(에이전트)GUI(그래픽 인터페이스)CLI(명령행 인터페이스)skill-mediated(스킬 매개)benchmark(벤치마크)verifier(검증기)

용어 해설

스킬 인터페이스(Skill Interface)
에이전트가 외부 명령이나 도구를 실행할 때 사용하는 추상화된 기능 단위로, 각 스킬은 특정 애플리케이션 조작이나 명령열 작업을 수행한다. 스킬 인터페이스는 CLI 에이전트의 행동을 구성하며 스킬의 유무와 범위가 성공률에 직접적인 영향을 미친다. 본 논문에서는 스킬 커버리지가 CLI 성능의 병목인지 여부를 판별하는 핵심 변수로 취급됐다.
검증기(Verifier)
에이전트가 목표 상태 달성 여부를 자동으로 판단하기 위해 사용하는 최종 상태 검사 장치로, 목표 진위 판별과 오류 원인 규명에 쓰인다. 본 연구에서는 동일한 최종 상태 검증기가 GUI와 CLI에게 동일한 성공 기준을 제공하여 비교를 통제하는 역할을 수행했다. Verifier 결과는 스킬 보강 효과를 측정하는 데 핵심 근거로 활용됐다.
실행 계층 벤치마크(Execution-layer Benchmark)
에이전트의 실제 소프트웨어 조작 능력만을 평가하기 위해 목적, 초기 상태, 허용된 동작, 최종 상태 검증기를 동일하게 맞춘 평가 집합이다. 이 벤치마크는 상호작용 모달리티 차이 외 다른 요인을 제거하여 GUI와 CLI의 실행 병목을 직접 비교할 수 있게 한다. 논문에서는 440개 데스크톱 작업으로 구성된 실행층 벤치마크를 구축해 실험을 수행했다.
그라운디드 상호작용(Grounded Interaction)
에이전트가 화면의 실제 요소와 연계해 정확한 클릭, 입력, 탐색을 수행하는 능력으로, 시각적 상태와 행위를 일치시키는 것을 의미한다. GUI 에이전트의 성공률은 이러한 그라운디드 상호작용의 신뢰성에 크게 좌우되며 장기간 워크플로에서 취약점이 드러난다. 본 연구에서는 GUI의 한계를 그라운디드 상호작용의 장기적 안정성 관점에서 해석했다.
장기 워크플로(Long-horizon Workflow)
다수의 연속적이고 상태 의존적인 조작 단계를 포함하는 작업 흐름으로, 각 단계의 실패가 전체 목표 미달성으로 이어질 가능성이 크다. 에이전트는 단계 간 상태 관리와 누적 오류 제어가 필요하며 GUI 에이전트는 특히 이 지점에서 성능 저하를 보였다. 논문은 장기 워크플로에서 그라운디드 상호작용의 신뢰성 문제가 병목으로 작용한다고 결론지었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 22.수집 2026. 06. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.