TL;DR
Agents’ Last Exam은 55개 하위 분야와 1,500개 실제 과제를 기반으로 에이전트의 실무 자동화 능력을 측정하기 위해 설계된 대규모 벤치마크로, 에이전트에 VM·Docker·GUI·CLI 접근을 허용하는 GCUA 환경에서 실행한 산출물을 결정적 검증기로 채점해 신뢰도를 확보했다. 과제 채택은 전문가 제출 패키지와 엔지니어·전문가 심사를 거치며 과제 풀은 6개월 단위로 순환해 과적합을 방지하고 재현 가능성을 유지한다. 평가 결과 가장 어려운 티어에서 평균 완전 통과율이 1% 미만으로 나타났고 모델 선택이 하니스보다 성능에 더 큰 영향을 미치며 경량 하니스로 비용을 41%까지 줄일 수 있음이 확인되었다. 이 결과는 단일 리더보드 숫자가 하위 도메인별 변화를 숨길 수 있음을 보여주며 향후 장기 과제·다중 에이전트 워크플로·도메인 특화 배치로 확장할 계획임을 시사한다.
빠른 이해
새로운 점
실제 전문가 워크플로 1,500개와 GCUA 환경을 결합해 결정적 자동 채점이 가능한 대규모 실무 중심 벤치마크를 제시한 점
핵심 메커니즘
에이전트는 격리된 런타임(환경 로드)을 받은 뒤 VM·Docker·GUI/CLI에서 작업을 실행하고 산출물을 제출하면 결정적 검증기 또는 허용 범위 검사로 최종 합격 여부를 판정한다.
핵심 수치
- Hardest-tier full pass rate: <1%- 여러 최첨단 구성의 평균치
- Claude Max evaluation cost: $4,000- 100개 과제 평가 비용으로 보고됨
- Cost reduction with lightweight harness: 41%- 경량 하니스 사용 시 비용 절감치
- Model vs harness variance: up to 18 points- 모델을 바꿀 때 관찰된 성능 변동 범위
- GUI vs CLI speed (current): ≈50x slower- 현재 GUI가 CLI보다 느린 대략적 배수
섹션별 상세
벤치마크의 목적과 설계 필요성
범위와 GCUA(Generalist Computer-Use Agent) 프레임
작업 수집·검증·제출 파이프라인
평가 환경과 채점 방식
주요 실험 결과와 계측값
- 가장 어려운 티어의 평균 완전 통과율은 1% 미만이다. — Results 섹션의 전체 성능 요약·리더보드 비교
- Claude Max로 100개 과제를 평가하는 데 약 4,000달러의 비용이 소요되었다. — Results 섹션의 비용 효율성 관련 문단
- 모델을 고정한 상태에서 하니스를 바꿀 때보다 하니스를 고정한 상태에서 모델을 바꿀 때 성능 차이가 더 크며 최대 18점의 분산이 관찰되었다. — Results 섹션의 모델·하니스 비교 실험 결과 문단
의미·한계·향후 계획
용어 해설
- Generalist Computer-Use Agent (GCUA)
- — GCUA는 GUI와 CLI를 포함해 실제 운영 환경(VM·Docker·GUI 렌더링·터미널)에 접근해 완전한 소프트웨어 작업 파이프라인을 수행하는 에이전트 유형을 말한다. 입력으로 사용자 작업 명세와 도구 접근권한을 받고 환경 내에서 파일 조작·시뮬레이션·코드 실행 등을 통해 최종 산출물을 생성하며, 결과는 외부 참조와 비교해 자동 검증된다. 실무 수준의 워크플로를 평가하는 데 핵심적이라서 벤치마크 설계에서 GUI·CLI·도구 접근을 모두 제공하는 점이 중요하다.
- Deterministic Code Verifier
- — 결정적 코드 검증기는 에이전트가 생성한 산출물을 규칙 기반 또는 스크립트 기반으로 자동 비교해 합격 여부를 판정하는 도구이다. 출력 파일 비교, 게임 상태 프레임 비교, 물리적 제약(충돌 여부) 검사처럼 주관성을 배제할 수 있는 방식으로 결과를 평가하여 신뢰도를 확보한다. 벤치마크의 재현성과 채점 일관성을 보장하므로 인간 판정 의존도를 줄이는 핵심 메커니즘이다.
- Acceptance Window
- — 허용 범위는 수치나 결과가 여러 정답을 가질 수 있는 작업에서 통과로 간주되는 값의 범위를 의미한다. 전문가가 정의한 상·하한 또는 제약 집합 내에 결과가 들어오면 전부 통과로 처리하고, 범위를 벗어나면 불통과로 판정해 수치적·구조적 불확실성을 관리한다. 수치 기반 검증과 구조 검증이 혼재하는 실무 과제에서 채점의 신뢰도를 높이는 수단이다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

