본문으로 건너뛰기

실제 업무를 끝내는 Agent의 조건

2026년 Agent 연구는 추론 점수보다 실제 업무 완료, 웹 실행, 실패 복구, 검증과 자기 개선을 평가하는 방향으로 이동하고 있습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

2026년 Agentic AI 연구는 짧은 질문의 정답률보다 실제 업무를 끝까지 수행하고 결과를 검증하며 실패에서 회복하는 능력에 초점을 맞추고 있습니다. Agents’ Last Exam은 1,000개 이상의 업무형 작업에서 가장 어려운 단계의 평균 full-pass rate가 2.6%에 그쳤음을 보였고, ClawBench는 실제 웹의 동적 상호작용을 포함한 평가에서 최고 task completion이 33.3%였다고 보고했습니다. Code as Agent Harness는 도구, 상태, 메모리, 실행, 검증을 연결하는 runtime의 중요성을 부각하며, AutoResearchClaw와 AREX는 각각 실험 복구와 조건별 후속 조사를 통해 연구 과정을 반복 개선합니다. 공통적으로 강한 Agent에는 모델뿐 아니라 실행 Harness, 실패 처리, 인간 또는 자동 검증, 이전 실행에서 얻은 교훈을 저장하는 구조가 필요합니다.

섹션별 상세

Agentic AI 연구의 관심사가 어려운 질문에 답하는 모델에서 실제 업무 흐름을 끝내는 시스템으로 이동하고 있습니다. Agents’ Last Exam은 250명 이상의 산업 전문가가 참여해 13개 산업과 55개 세부 분야의 1,000개 이상 작업을 구성하고, 최종 결과물이 검증 가능한지를 평가합니다. 가장 어려운 단계에서 주류 Agent Harness와 backbone 조합의 full-pass rate 평균은 2.6%에 그쳐 부분적인 진전만으로는 실무 완료를 보장하기 어렵다는 점을 드러냅니다.
Agents’ Last Exam의 제목과 Website, GitHub, HuggingFace, Leaderboard 연결을 담은 배너입니다.
Other이미지는 기사에서 소개한 Agents’ Last Exam이 독립적인 평가 프로젝트와 공개 리더보드 형태로 제공된다는 점을 시각적으로 뒷받침합니다. 다만 benchmark의 작업 수나 2.6% full-pass rate 같은 핵심 수치는 이 배너에 나타나지 않습니다.
근거
  • Agents’ Last Exam은 250명 이상의 산업 전문가 의견을 바탕으로 13개 산업과 55개 세부 분야의 1,000개 이상 작업을 평가한다. Agents’ Last Exam 섹션의 첫 문단에 제시된 benchmark 구성 수치
  • Agents’ Last Exam의 가장 어려운 단계에서 주류 Agent Harness와 backbone 조합의 full-pass rate 평균은 2.6%였다. Agents’ Last Exam 섹션의 What the paper found 단락
ClawBench는 정제된 모의 환경이 아니라 실제 웹사이트에서 Agent가 일상 업무를 수행하는 상황을 측정합니다. 쇼핑, 여행, 채용, 금융, 사무 업무에 걸친 144개 플랫폼의 153개 작업에서 인증, 동적 페이지, 긴 양식, 문서, 예기치 않은 상호작용이 실행 과정에 포함됩니다. Session replay, screenshots, HTTP traffic, Agent messages, browser actions를 수집하고 최종 제출 요청을 가로막아 되돌릴 수 없는 행동을 방지했으며, 7개 frontier model 중 최고 task completion은 33.3%였습니다.
ClawBench의 종합 작업 범주, Sandbox와 실제 웹 평가 방식, Agentic Evaluator, 모델별 task completion rate를 비교한 도표입니다.
Chart도표는 Offline/Sandbox 평가가 정적 HTML과 고정 DOM 구조에 머무는 반면 ClawBench는 동적 페이지, 쿠키 동의 팝업, 복잡한 다단계 상호작용을 포함한다는 차이를 보여줍니다. 오른쪽 비교 그래프에는 Claude-sonnet-4.6의 점수 72.5, 66.4, 33.3과 GPT-5.4의 점수 75.0, 67.3, 6.5가 표시되어 실제 웹 작업 평가가 모델 간 차이를 드러내는 방식을 나타냅니다.
근거
  • ClawBench는 144개 플랫폼의 153개 일상 웹 작업을 평가하고, 7개 frontier model 중 최고 task completion은 33.3%였다. ClawBench 섹션의 작업 범위와 What the paper found 단락
Code as Agent Harness는 Agent 성능을 모델의 추론 능력만으로 보지 않고 모델 주변의 실행 구조까지 포함해 바라봅니다. 코드가 추론을 행동과 환경에 연결하고, planning, memory, tool use, feedback, optimization을 관리하며, 공유 산출물을 통해 여러 Agent의 상태 보존과 검토를 지원하는 구조입니다. 따라서 모델이 강해도 runtime이 취약하면 신뢰할 수 있는 Agent가 되기 어렵고, Harness engineering이 Agent 설계의 핵심 계층으로 자리 잡습니다.
AutoResearchClaw는 과학 연구를 한 번의 논문 생성이 아니라 실패와 수정이 반복되는 과정으로 구성합니다. Multi-Agent Debate가 가설 생성과 결과 분석에 참여하고, 실패한 실험은 중단 사유가 아니라 실행 경로를 복구하거나 방향을 바꾸는 Refine 또는 Pivot의 입력으로 쓰입니다. 일곱 가지 human-intervention mode와 검증 절차를 포함하며, 25개 주제의 ARC-Bench 실험 단계 벤치마크에서 AI Scientist v2보다 54.7% 높은 결과를 보고했습니다.
AutoResearchClaw의 연구 범위 설정, 문헌 탐색, 지식 종합, 실험, 자기 복구, 분석, 논문 작성과 검증을 연결한 다단계 연구 자동화 구조입니다.
Diagram도표는 연구 아이디어가 Phase 1의 탐색에서 시작해 문헌 검색과 가설 토론을 거친 뒤 Phase 2의 실험 및 자기 복구, Phase 3의 논문 작성과 최종 검증으로 이어지는 흐름을 보여줍니다. 하단의 Cross-Run Evolution System은 지속적인 lesson store와 프롬프트 오버레이를 통해 여러 실행의 학습 결과를 다음 단계에 반영하는 구조를 나타냅니다.
근거
  • AutoResearchClaw는 ARC-Bench의 25개 주제 실험 단계 벤치마크에서 AI Scientist v2보다 54.7% 높은 결과를 보고했다. AutoResearchClaw 섹션의 What stands out 부분 마지막 문장
AREX는 답을 찾는 과정과 답이 특정 조건을 만족하는지 확인하는 과정을 분리해 Deep Research를 반복 개선합니다. 한 루프가 근거를 수집하고 답을 구성하면 다른 루프가 조건별로 감사를 수행하며, 지원되지 않은 항목이 남을 때 전체 탐색 대신 해당 부분만 후속 조사합니다. 학습된 context-update tool이 긴 상호작용 기록을 검증된 근거와 미해결 조건 중심의 작은 개선 상태로 압축하고, dense 4B model과 더 큰 mixture-of-experts model을 agentic mid-training 및 long-horizon reinforcement learning으로 학습했습니다.
AREX가 Deep Research에서 정보 수집, 성찰, 자기 개선, 반복 적용, 지식 축적을 순환하는 과정을 나타낸 도식입니다.
Diagram도식은 AREX가 정보를 모은 뒤 결과를 성찰하고 전략과 지식을 개선한 다음 다음 연구 주기에 적용하며, 고품질 통찰을 축적하는 순환 구조를 보여줍니다. 이는 기사에서 설명한 검증 기반의 후속 연구와 장기적인 Agent 개선이라는 핵심 방향과 직접 연결됩니다.
근거
  • AREX는 제약 조건별 검증과 targeted follow-up research를 사용해 지원되지 않은 조건만 다시 조사한다. AREX 섹션의 두 루프 설명과 What makes it different 부분

용어 해설

장기 작업 실행(Long-Horizon Execution)
여러 단계와 도구 사용이 이어지는 긴 작업을 중간 상태를 유지하며 끝까지 수행하는 능력입니다. 단일 질문의 정답률보다 계획 수립, 실행, 오류 복구, 최종 산출물 검증이 중요하며 실제 업무형 Agent 평가의 핵심 기준으로 활용됩니다.
Agent Harness
모델이 환경과 상호작용하도록 연결하는 실행 인프라입니다. 코드가 도구 호출, 메모리, 상태 관리, 제어 흐름, 피드백, 결과 검증을 묶어 주며 모델 자체의 능력만으로는 부족한 안정성과 지속 실행을 보완합니다.
제약 조건별 검증(Constraint-Wise Verification)
연구 결과가 요구된 조건을 각각 충족하는지 항목별로 확인하는 방식입니다. 전체 탐색을 반복하지 않고 근거가 빠진 조건만 찾아 후속 조사를 실행하므로, 답변 생성과 검증을 분리하면서 불확실성을 좁힐 수 있습니다.
Multi-Agent Debate
여러 Agent가 가설이나 분석 결과를 서로 다른 관점에서 검토하는 절차입니다. 한 가지 추론 경로가 검증 없이 지배하는 문제를 줄이고, AutoResearchClaw에서는 가설 생성과 결과 분석 단계의 판단을 보완하는 데 사용됩니다.
장기 작업 강화학습(Long-Horizon Reinforcement Learning)
긴 시간 범위의 작업에서 여러 행동과 결과를 연결해 Agent의 실행 전략을 학습시키는 방식입니다. AREX는 agentic mid-training과 함께 이를 사용해 연구 및 도구 사용 벤치마크에서 장기 작업 능력을 평가했습니다.

기술

  • Agents’ Last Exam
  • ClawBench
  • Code as Agent Harness
  • AutoResearchClaw
  • AREX
  • Agent Harness
  • Multi-Agent Debate
  • ARC-Bench
  • AI Scientist v2
  • agentic mid-training
  • long-horizon reinforcement learning
  • BrowseComp
  • WideSearch
  • DeepSearchQA
  • Humanity’s Last Exam

활용 사례

  • 전문 업무 흐름의 종단간 자동화
  • 실시간 웹사이트 기반 쇼핑·여행·채용·금융 업무
  • 여러 Agent가 참여하는 과학 연구와 논문 작성
  • 근거 수집과 조건별 검증을 결합한 Deep Research
  • 실험 실패 복구와 연구 과정의 반복 개선
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.