본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

tencent/UI-Mate-27B

스크린샷 기반 데스크톱 GUI 조작과 장기 작업 수행27BApache-2.0

실시간 화면을 읽고 마우스·키보드 행동으로 장기 GUI 작업을 수행하는 27B 에이전트

학습 방식 · Qwen3.6-27B 기반 SFT 후 실행 가능한 GUI 환경에서 Online Reinforcement Learning을 적용한 Fine-tuning

TL;DR

UI-Mate-27B는 Qwen3.6-27B를 기반으로 SFT와 Online Reinforcement Learning을 거친 open-weight GUI 에이전트 Fine-tune 모델입니다. 자연어 지시, 실시간 스크린샷, 상호작용 기록을 입력받아 화면 상태를 해석하고 마우스·키보드·스크롤·대기·사용자 확인·작업 완료 호출로 변환합니다. 좌표를 그대로 재생하지 않고 화면 변화에 맞춰 계획을 다시 세우므로 여러 애플리케이션을 넘나드는 장기 작업을 겨냥합니다. OSWorld-Verified 평균 77.0점, WindowsAgentArena 평균 66.2점, OSWorkerBench strict success 41.00을 기록했으며, 실행에는 vLLM과 공식 agent harness가 필요합니다.

핵심 포인트

  • Qwen3.6-27B를 GUI 에이전트로 Fine-tuning해 화면 인식과 도구 호출을 결합합니다.
  • 현재 화면과 상호작용 기록을 읽고 마우스·키보드·스크롤 명령을 구조화해 실행합니다.
  • SFT 뒤 실행 가능한 GUI 환경에서 Online Reinforcement Learning을 적용했습니다.
  • OSWorld-Verified 77.0점과 WindowsAgentArena 66.2점으로 Ubuntu·Windows 작업을 평가했습니다.

제한사항

  • 화면 구성과 애플리케이션 버전, 디스플레이 배율, 지연 시간에 따라 조작 결과가 달라질 수 있습니다. 모델은 현재 화면을 기준으로 계획을 다시 세우지만 임의의 환경에서 안정적인 실행을 보장하지 않습니다. 실제 작업 결과를 확인하려면 상호작용 궤적을 감시하고 애플리케이션 상태를 직접 검증해야 합니다.
  • UI-Mate-27B는 예측한 행동을 실행할 외부 런타임이 필요한 에이전트 체크포인트이며 독립적인 visual-chat 모델이 아닙니다. 공식 prompt와 response parser, interaction harness를 함께 사용해야 합니다. Prompt injection이나 파괴적 작업이 발생할 수 있으므로 격리 환경과 민감한 작업 전 사람의 확인이 필요합니다.

벤치마크

벤치마크지표비교
OSWorld-Verifiedaverage score77.0
WindowsAgentArenaaverage score66.2
OSWorkerBenchstrict success41.00
OSWorkerBenchprogress76.86

79

LIKES

421

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.