본문으로 건너뛰기

OSWorld 2.0, 장기 컴퓨터 작업의 벽

300단계가 넘는 실제 컴퓨터 작업에서 최고 시스템도 완전 성공률 20.6%에 머물렀다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OSWorld 2.0은 31개 자체 호스팅 웹사이트와 전문 데스크톱 애플리케이션을 가로지르는 108개의 장기 컴퓨터 사용 작업으로, 평균 300단계가 넘는 실제 업무형 에이전트 능력을 측정합니다. 작업마다 평균 27개의 체크포인트를 두어 부분 점수를 산출하지만, 최종 가상 머신 상태만 평가하므로 체크포인트의 선후 관계는 직접 확인하지 않습니다. 논문 작성 당시 최고 성능 시스템인 Claude Opus 4.8의 완전 성공률은 20.6%였고, 발표 직전 공개된 Claude Fable 5.1은 부분 점수 60% 초과와 완전 성공률 45% 초과를 기록했습니다. 반복되는 실패는 누락된 정보, 복잡한 화면과 튜토리얼 인식, 완료 여부 검증 부족, 장기 기억 감쇠로 모였으며, 화면을 본 뒤 행동하는 현재 구조는 작업 중 변하는 환경에 취약했습니다.

빠른 이해

새로운 점

짧은 단일 앱 과제 대신 평균 300단계 이상의 다중 앱 업무와 31개 자체 호스팅 환경을 묶고, 부분 점수와 안전 체크포인트까지 결합했습니다.

핵심 메커니즘

에이전트가 튜토리얼과 작업 목표를 입력으로 받아 여러 앱·파일·웹사이트의 정보를 수집하고, 충돌하는 신호와 환경 변화를 확인하며 계획을 수정한 뒤 가상 머신의 최종 상태를 만듭니다. 평가기는 평균 27개의 체크포인트와 안전 조건을 독립적으로 채점해 완전 성공 여부와 부분 수행 정도를 함께 산출합니다.

핵심 수치

  • 작업 수·환경 범위: 108개 작업, 31개 자체 호스팅 웹사이트- 실제 업무형 컴퓨터 사용 워크플로
  • 작업 길이: 평균 300단계 초과, 일부 300~500단계- OSWorld 1.0은 약 30단계
  • 인간 수행 시간: 중앙값 약 1시간 30분- 69.6%의 작업은 숙련된 사람이 1시간 이상 소요
  • Claude Opus 4.8: 완전 성공률 20.6%, 부분 점수 54.8%- 논문 작성 당시 최고 성능 평가 모델
  • Claude Fable 5.1: 부분 점수 60% 초과, 완전 성공률 45% 초과- 발표 24시간 이내 공개된 모델의 결과
  • 채점 체크포인트: 작업당 평균 27개- 중요도와 난도에 따라 가중치 적용

섹션별 상세

01

실제 업무를 닮은 장기 작업

기존 OSWorld 1.0은 최고 시스템의 정확도가 80%를 넘으며 포화에 가까워졌고, 실제 업무에서 컴퓨터 에이전트가 완벽하지 않다는 문제를 충분히 드러내기 어려웠습니다. OSWorld 2.0은 작업 길이를 300~500단계로 늘리고 여러 애플리케이션을 한 과제에 묶어, 에이전트가 지시를 읽고 도구를 선택하며 앞서 얻은 정보를 끝까지 유지하도록 구성했습니다. 대표적인 비용 환급 과제에서는 Gmail, 로컬 파일, 예약 애플리케이션, 은행 계좌를 순서 없이 오가며 영수증과 결제 정보를 모으고, 이전 제출 기록에서 개인 ID를 찾아야 합니다. 같은 화면에 여러 금액이 있거나 Gmail 팝업으로 숫자가 바뀌는 상황까지 포함해, 짧고 정돈된 스크립트보다 실제 업무의 불확실성이 성능을 좌우하게 했습니다.
02

자체 호스팅과 부분 점수

실시간 웹사이트는 내용과 동작이 바뀌어 평가 조건을 흔들 수 있으므로, OSWorld 2.0은 자주 쓰이는 웹사이트 31개를 자체 호스팅해 환경을 고정했습니다. 한 작업의 예상 인간 수행 시간 중앙값은 약 1시간 30분이고 에이전트 궤적은 평균 300단계를 넘으며, 각 과제에는 평균 27개의 채점 체크포인트가 배치됩니다. 체크포인트는 작업 전체의 중요도와 난도를 기준으로 가중치를 달리해 단순한 이름 입력보다 핵심 숫자 수집과 처리를 더 크게 반영합니다. 최종 가상 머신 상태만 확인하는 구조라 각 체크포인트는 독립 채점되며, 앞 단계가 틀려도 뒤 단계가 맞으면 뒤 점수를 받을 수 있다는 한계가 남습니다.
03

에이전트가 마주하는 열 가지 난제

OSWorld 2.0은 여러 출처의 정보를 합치는 교차 출처 추론, CAD와 Blender처럼 비텍스트 조작이 필요한 가상 특화 작업, 사용할 앱을 직접 찾아야 하는 암묵적 상태 추론을 포함합니다. 화면과 HTML처럼 서로 다른 표현이 충돌하는 과제에서는 콘서트 좌석의 시각적 위치와 실제 좌석 ID 중 무엇을 신뢰할지 결정해야 하고, PDF·블로그·영상 튜토리얼 과제에서는 지시를 임의의 지름길로 바꾸지 않고 따라야 합니다. 작업 중 Gmail 알림이 나타나는 동적 환경과 팝업이 움직이는 스트리밍 작업은 한 번의 스크린샷에 의존하는 순차 처리 구조를 압박하며, 잘못된 국가의 개인 ID를 발견하면 사용자에게 되묻는 능력도 채점합니다. 연구팀은 전문가 인터뷰, 설문, 팀의 일상 업무, YouTube와 블로그 자료에서 과제를 만들고 전문가·다른 에이전트·사람의 검증을 거쳤습니다.
04

Claude와 GPT의 정확도·효율성 분리

결과에서는 정확도와 효율성이 서로 다른 축으로 나타났으며, Claude Opus 계열은 정확도가 높고 GPT 계열은 더 적은 출력 토큰으로 낮은 수준의 결과에 도달하는 경향을 보였습니다. 논문 작성 당시 가장 강한 평가 모델인 Claude Opus 4.8은 완전 성공률 20.6%, 부분 점수 54.8%를 기록했습니다. 발표 24시간 이내 공개된 Claude Fable 5.1은 부분 점수 60% 초과와 완전 성공률 45% 초과를 기록해 당시 수치를 크게 앞섰지만, 이는 벤치마크 결과가 최신 모델 출시에 따라 빠르게 변한다는 점도 함께 드러냅니다. Claude는 동적 환경과 교차 출처 추론처럼 에이전트 중심 범주에서, GPT는 가상 특화 작업과 멀티모달 편집에서 상대적으로 높은 성과를 냈습니다.
05

네 가지 반복 실패와 안전 채점

정보 누락에서는 긴 지시와 환경 세부 사항을 놓치고 모호하거나 충돌하는 정보를 확인하기보다 추측하는 경향이 나타났습니다. 인식 실패는 특히 긴 영상 튜토리얼과 익숙하지 않은 애플리케이션에서 조작 계획을 세우기 어렵게 만들었고, 검증 실패는 미완료 상태를 완료로 오인하거나 중간에 이상을 발견해도 이전 단계를 되돌아보지 않는 방식으로 나타났습니다. 기억 실패는 OSWorld 1.0의 약 30단계에서 OSWorld 2.0의 최대 300단계로 궤적이 길어지면서 초기에 읽은 숫자를 후반에 잊는 문제와 연결됐습니다. 안전 채점은 GitLab에 커밋하면 안 되는 API key 유출, 파일 삭제 같은 부작용, 안전하지 않은 모방 웹사이트 클릭을 각각 감점해 작업 완료와 무모한 행동을 분리했습니다.
06

다음 세대 에이전트의 관찰 구조

현재 에이전트는 스크린샷을 찍고 그 상태를 추론한 다음 행동하는 순환을 반복하지만, 추론 중 팝업이나 알림이 생기면 행동 시점의 화면이 캡처 시점과 달라질 수 있습니다. 이 구조에서는 당시 화면에 맞는 클릭이 실제 실행 시점에는 잘못된 행동이 될 수 있어, 환경이 계속 움직이는 스트리밍 작업에서 취약성이 커집니다. 연구팀은 이 문제를 장기 작업 전반의 성능 저하와 연결하며, 에이전트가 행동 직전 상태를 다시 관찰하고 변화에 맞춰 계획을 수정하는 방향을 중요한 연구 과제로 보았습니다. 다만 OSWorld 2.0은 현재 일상 애플리케이션 중심으로 구성됐고, 의학·법률·금융처럼 전문가용 소프트웨어를 포함할 때 동일한 능력 문제가 반복될지는 아직 열린 질문으로 남았습니다.

용어 해설

장기 작업 에이전트(Long-Horizon Agent)
짧은 명령이 아니라 수백 단계에 걸친 컴퓨터 작업을 수행하는 AI 에이전트입니다. 초기 단계에서 수집한 정보를 기억하고 여러 애플리케이션을 오가며 상태 변화에 맞춰 계획을 수정해야 하므로 단순한 클릭 자동화보다 높은 추론·기억·검증 능력이 필요합니다.
부분 점수(Partial Credit)
전체 작업의 성공 여부만 판정하지 않고, 작업을 여러 체크포인트로 나눠 완료한 부분마다 점수를 부여하는 평가 방식입니다. 긴 작업에서 일부 단계만 성공한 에이전트의 진행 정도를 수치화할 수 있지만, 체크포인트 간 순서와 의존성을 완전히 반영하지 못할 수 있습니다.
자체 호스팅 환경(Self-Hosted Environment)
실제 인터넷의 변동성을 줄이기 위해 평가에 필요한 웹사이트와 애플리케이션을 연구팀이 직접 운영하는 환경입니다. OSWorld 2.0은 31개 웹사이트를 자체 호스팅해 외부 사이트 변경으로 평가 결과가 흔들리는 문제를 줄이고, 동일한 조건에서 에이전트를 비교합니다.
암묵적 상태 추론(Implicit-State Inference)
작업 지시문이 사용할 애플리케이션이나 현재 상태를 직접 알려주지 않을 때, 에이전트가 목표와 화면·파일·기록을 바탕으로 적절한 도구와 다음 행동을 스스로 찾아내는 능력입니다. 명시적인 앱 이름에 의존하지 않는 실제 업무 상황을 재현합니다.
스트리밍 작업(Streaming Task)
에이전트가 화면을 한 번 캡처한 뒤 생각하고 행동하는 동안에도 팝업이나 알림처럼 환경이 계속 변하는 작업입니다. 캡처 시점과 실제 행동 시점의 상태가 달라질 수 있어, 오래된 화면 정보에 근거한 행동과 실시간 재관찰 능력을 평가합니다.

기술

  • OSWorld 2.0
  • Claude Opus
  • Claude Opus 4.8
  • Claude Fable 5.1
  • GPT
  • Gmail
  • Blender
  • CAD
  • GitLab
  • YouTube
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 09. 04.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.