본문으로 건너뛰기

Tencent의 GUI 에이전트 UI-Mate-27B

UI-Mate-27B가 실시간 화면 인식과 재계획으로 데스크톱 작업을 자동화합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

UI-Mate-27B는 실시간 스크린샷과 자연어 지시를 바탕으로 여러 운영체제와 애플리케이션에서 키보드·마우스 행동을 수행하는 27B 오픈 웨이트 GUI 에이전트입니다. 일반 컴퓨터 사용과 시연 기반 작업을 지원하며, 시연을 고정된 좌표 스크립트가 아니라 재계획 가능한 절차 지침으로 활용합니다. Supervised Fine-Tuning 뒤 온라인 강화학습을 실행 가능한 GUI 환경에서 진행하고, pyautogui 호환 도구 호출과 OpenAI 호환 인터페이스를 제공합니다. 원문은 Ubuntu와 Windows 벤치마크에서 강한 성능을 언급하지만 구체적인 수치는 제시하지 않습니다.

실용적 조언

  • GUI 에이전트를 평가할 때 단일 클릭 정확도만 보지 말고 여러 애플리케이션과 화면 상태 변화가 포함된 장기 작업으로 테스트해야 합니다. UI-Mate-27B의 입력 구성처럼 작업 지시, 스크린샷, 상호작용 기록을 함께 사용하면 현재 상태를 반영한 재계획 능력을 측정할 수 있습니다. Ubuntu와 Windows 양쪽에서 동일한 절차를 비교하면 운영체제별 일반화 차이도 확인할 수 있습니다.
  • 시연 기반 자동화를 구현할 때 성공한 행동 목록을 좌표 스크립트로 고정하기보다 현재 화면을 기준으로 다음 행동을 결정하는 구조를 사용해야 합니다. 화면의 내용이나 배치가 달라질 때 모델이 관찰과 재계획을 반복하도록 구성하면 절차 재사용성이 높아집니다. 실제 배포 전에는 대기, 사용자 확인, 작업 완료 같은 종료 조건을 별도로 검증해야 합니다.

섹션별 상세

01
UI-Mate-27B는 자연어 작업 지시와 실시간 스크린샷을 입력으로 받아 화면 상태를 추론하고 키보드·마우스 행동을 출력하는 27B GUI 에이전트입니다. 입력에는 상호작용 기록과 선택적인 시연 맥락도 포함되며, 출력은 추론과 간결한 행동 설명, 구조화된 도구 호출로 구성됩니다. 이 구조는 단순한 화면 인식 모델이 아니라 여러 단계의 데스크톱 작업을 실행하는 에이전트 설계를 전제로 합니다.
02
이 모델의 시연 기반 모드는 한 번 성공한 작업의 행동 순서를 고정된 스크립트로 복사하지 않습니다. 시연에서 추출한 재사용 가능한 절차를 지침으로 활용하되, 새 작업에서 애플리케이션의 내용·배치·현재 상태가 달라지면 실시간 화면을 다시 읽고 행동 계획을 조정합니다. 따라서 좌표 재생보다 화면 변화에 대응하는 장기 작업 실행을 목표로 합니다.
03
학습 과정은 Supervised Fine-Tuning과 실행 가능한 GUI 환경에서의 온라인 강화학습을 결합합니다. 모델은 Ubuntu와 Windows 환경에서 여러 애플리케이션을 거치는 작업을 수행하며, 마우스·키보드·스크롤·대기·사용자 상호작용·작업 완료를 행동 공간으로 사용합니다. 원문은 두 운영체제 벤치마크에서 강한 성능을 언급하지만 구체적인 점수는 제공하지 않습니다.
04
UI-Mate-27B는 Apache-2.0 라이선스로 공개되고 OpenAI 호환 서빙 및 클라이언트 인터페이스를 지원합니다. 출력 행동은 pyautogui와 호환되는 구조화된 형식이어서 네이티브 데스크톱 조작 파이프라인에 연결할 수 있습니다. 모델 가중치와 코드, 프로젝트 페이지, 논문 링크가 함께 제공되어 실행과 추가 검증을 위한 공개 경로를 마련했습니다.

용어 해설

GUI 에이전트(GUI Agent)
화면의 시각적 상태를 읽고 사용자의 자연어 지시에 따라 키보드와 마우스를 조작하는 AI 시스템입니다. 좌표나 고정된 매크로를 그대로 재생하지 않고 현재 인터페이스를 바탕으로 다음 행동을 다시 결정합니다.
장기 작업(Long-Horizon Task)
여러 단계의 행동을 순서대로 수행해야 하며 중간에 애플리케이션이나 화면 상태가 바뀔 수 있는 작업입니다. UI-Mate-27B는 여러 앱과 운영체제를 넘나드는 긴 작업에서 매 단계 화면을 확인하고 계획을 갱신합니다.
온라인 강화학습(Online Reinforcement Learning)
실행 가능한 환경에서 모델이 행동을 수행하고 그 결과를 바탕으로 정책을 갱신하는 학습 방식입니다. UI-Mate-27B는 GUI 환경에서의 Supervised Fine-Tuning 이후 온라인 강화학습을 거쳐 화면 조작 능력을 학습했습니다.
구조화된 도구 호출(Structured Tool Call)
모델의 추론 결과를 마우스 이동·클릭, 키보드 입력, 스크롤, 대기 같은 실행 가능한 명령 형식으로 전달하는 방식입니다. UI-Mate-27B는 간결한 행동 설명과 함께 pyautogui와 호환되는 컴퓨터 사용 도구 호출을 출력합니다.

언급된 도구

pyautogui중립

구조화된 마우스·키보드 행동을 실제 데스크톱 입력으로 실행하는 Python 기반 자동화 라이브러리

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.