TL;DR
OSWorld 2.0은 평균 300단계가 넘고 여러 애플리케이션을 가로지르는 108개 실제 컴퓨터 작업으로, 짧고 정형화된 벤치마크에서 드러나지 않던 에이전트의 한계를 측정합니다. 31개 웹사이트를 자체 호스팅하고 작업당 평균 27개 Checkpoint로 부분 점수를 계산해 정보 수집, 실행, 안전성의 진행 정도를 나눠 평가합니다. 논문 기준 최고 시스템인 Claude Opus 4.8은 완전 성공 20.6%, 부분 점수 54.8%에 그쳤으며, 발표 직전 공개된 Claude Fable 5.1은 부분 점수 60% 이상과 완전 성공 45% 이상을 기록했습니다. 반복되는 실패는 누락된 정보, 복잡한 화면 인식, 완료 여부 검증 부족, 장기 기억 저하로 묶이며, 화면을 보고 생각하는 동안 환경이 변하는 Streaming Task가 구조적 약점으로 남습니다.
빠른 이해
새로운 점
평균 300단계가 넘는 108개 다중 앱 작업과 31개 자체 호스팅 웹사이트로 Long-Horizon Computer-Use Agent를 평가하고, 완전 성공과 부분 점수·안전성까지 분리한 벤치마크입니다.
핵심 메커니즘
에이전트는 튜토리얼과 여러 앱의 화면·파일·계정 정보를 입력으로 받아 출처 간 대조, 앱 선택, 계획 수정, 사용자 질의를 거쳐 작업을 수행합니다. 시스템은 최종 가상 머신 상태를 평균 27개 Checkpoint와 안전성 기준으로 채점해 완전 성공 여부와 부분 점수를 함께 산출하며, LLM Judge의 비중은 50% 미만으로 제한합니다.
핵심 수치
- 평가 작업 수: 108개 장기·실제 컴퓨터 작업- 31개 자체 호스팅 웹사이트와 전문 데스크톱 애플리케이션에 걸친 작업
- 평균 에이전트 궤적: 300단계 초과- 개별 작업 궤적은 약 300~500단계
- 인간 작업 시간: 69.6%의 작업은 숙련된 사람이 1시간 초과- 작업별 인간 완료 시간 추정치 기준
- Claude Opus 4.8 완전 성공: 20.6%- 논문 작성 당시 평가된 최고 모델의 이진 완료 점수
- Claude Opus 4.8 부분 점수: 54.8%- 평균 27개 Checkpoint를 활용한 부분 점수
- Claude Fable 5.1: 부분 점수 60% 초과, 완전 성공 45% 초과- 발표 24시간 이내 공개된 모델에 대한 발표 외 추가 결과
섹션별 상세
포화된 OSWorld의 후속작
환급 업무로 본 작업 복잡도
열 가지 난제와 자체 호스팅 환경
작업 제작과 검증 절차
Claude와 GPT의 성능 분화
실패 원인과 안전성 평가
용어 해설
- 장기 작업 에이전트(Long-Horizon Agent)
- — 한 번의 짧은 명령이 아니라 수백 단계의 작업을 순서대로 수행하는 Computer-Use Agent입니다. 앞 단계에서 얻은 정보를 기억하고, 여러 애플리케이션을 오가며 상태 변화를 감지한 뒤 다음 행동을 선택해야 하므로 단순한 클릭 자동화보다 높은 계획·기억·검증 능력이 필요합니다.
- 부분 점수(Partial Credit)
- — 전체 작업의 성공 여부만 0 또는 1로 판단하지 않고, 작업을 여러 Checkpoint로 나누어 완료한 비율을 측정하는 평가 방식입니다. 중요한 정보 입력이나 어려운 처리에는 더 높은 가중치를 부여해 긴 작업에서 에이전트가 실제로 어느 정도까지 수행했는지 드러냅니다.
- 암묵적 상태 추론(Implicit-State Inference)
- — 작업 지시문에 사용할 애플리케이션이나 현재 상태가 직접 적혀 있지 않을 때, 목표와 화면 정보를 바탕으로 적절한 도구와 다음 행동을 추론하는 과정입니다. OSWorld 2.0에서는 에이전트가 앱 선택 단계부터 스스로 해결해야 하므로 도구 선택과 계획 수립 능력을 함께 평가합니다.
- 교차 출처 추론(Cross-Source Reasoning)
- — Gmail, 은행 계정, 로컬 파일처럼 서로 다른 출처에 흩어진 정보를 모아 하나의 작업에 사용할 값을 결정하는 추론 방식입니다. 각 출처의 숫자와 기록을 대조하고 필요한 정보를 합성해야 하므로 단일 화면의 텍스트를 읽는 능력만으로는 충분하지 않습니다.
- 스트리밍 작업(Streaming Task)
- — 에이전트가 생각하는 동안 화면과 애플리케이션 상태가 계속 변하는 환경에서 수행하는 작업입니다. 스크린샷을 한 번 찍고 행동하는 기존 루프에서는 팝업이나 알림이 행동 직전에 나타날 수 있어, 오래된 화면 정보에 근거한 클릭이 현재 상태와 어긋날 수 있습니다.
기술
- Computer-Use Agent
- Gmail
- Airbnb
- GitLab
- CAD
- Blender
- HTML
- LLM Judge
- YouTube
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.