TL;DR
2026년 Agentic AI 연구는 짧은 질문의 정답률보다 실제 업무를 끝까지 수행하고 결과를 검증하며 실패에서 회복하는 능력에 초점을 맞추고 있습니다. Agents’ Last Exam은 1,000개 이상의 업무형 작업에서 가장 어려운 단계의 평균 full-pass rate가 2.6%에 그쳤음을 보였고, ClawBench는 실제 웹의 동적 상호작용을 포함한 평가에서 최고 task completion이 33.3%였다고 보고했습니다. Code as Agent Harness는 도구, 상태, 메모리, 실행, 검증을 연결하는 runtime의 중요성을 부각하며, AutoResearchClaw와 AREX는 각각 실험 복구와 조건별 후속 조사를 통해 연구 과정을 반복 개선합니다. 공통적으로 강한 Agent에는 모델뿐 아니라 실행 Harness, 실패 처리, 인간 또는 자동 검증, 이전 실행에서 얻은 교훈을 저장하는 구조가 필요합니다.
섹션별 상세

- Agents’ Last Exam은 250명 이상의 산업 전문가 의견을 바탕으로 13개 산업과 55개 세부 분야의 1,000개 이상 작업을 평가한다. — Agents’ Last Exam 섹션의 첫 문단에 제시된 benchmark 구성 수치
- Agents’ Last Exam의 가장 어려운 단계에서 주류 Agent Harness와 backbone 조합의 full-pass rate 평균은 2.6%였다. — Agents’ Last Exam 섹션의 What the paper found 단락

- ClawBench는 144개 플랫폼의 153개 일상 웹 작업을 평가하고, 7개 frontier model 중 최고 task completion은 33.3%였다. — ClawBench 섹션의 작업 범위와 What the paper found 단락

- AutoResearchClaw는 ARC-Bench의 25개 주제 실험 단계 벤치마크에서 AI Scientist v2보다 54.7% 높은 결과를 보고했다. — AutoResearchClaw 섹션의 What stands out 부분 마지막 문장

- AREX는 제약 조건별 검증과 targeted follow-up research를 사용해 지원되지 않은 조건만 다시 조사한다. — AREX 섹션의 두 루프 설명과 What makes it different 부분
용어 해설
- 장기 작업 실행(Long-Horizon Execution)
- — 여러 단계와 도구 사용이 이어지는 긴 작업을 중간 상태를 유지하며 끝까지 수행하는 능력입니다. 단일 질문의 정답률보다 계획 수립, 실행, 오류 복구, 최종 산출물 검증이 중요하며 실제 업무형 Agent 평가의 핵심 기준으로 활용됩니다.
- Agent Harness
- — 모델이 환경과 상호작용하도록 연결하는 실행 인프라입니다. 코드가 도구 호출, 메모리, 상태 관리, 제어 흐름, 피드백, 결과 검증을 묶어 주며 모델 자체의 능력만으로는 부족한 안정성과 지속 실행을 보완합니다.
- 제약 조건별 검증(Constraint-Wise Verification)
- — 연구 결과가 요구된 조건을 각각 충족하는지 항목별로 확인하는 방식입니다. 전체 탐색을 반복하지 않고 근거가 빠진 조건만 찾아 후속 조사를 실행하므로, 답변 생성과 검증을 분리하면서 불확실성을 좁힐 수 있습니다.
- Multi-Agent Debate
- — 여러 Agent가 가설이나 분석 결과를 서로 다른 관점에서 검토하는 절차입니다. 한 가지 추론 경로가 검증 없이 지배하는 문제를 줄이고, AutoResearchClaw에서는 가설 생성과 결과 분석 단계의 판단을 보완하는 데 사용됩니다.
- 장기 작업 강화학습(Long-Horizon Reinforcement Learning)
- — 긴 시간 범위의 작업에서 여러 행동과 결과를 연결해 Agent의 실행 전략을 학습시키는 방식입니다. AREX는 agentic mid-training과 함께 이를 사용해 연구 및 도구 사용 벤치마크에서 장기 작업 능력을 평가했습니다.
기술
- Agents’ Last Exam
- ClawBench
- Code as Agent Harness
- AutoResearchClaw
- AREX
- Agent Harness
- Multi-Agent Debate
- ARC-Bench
- AI Scientist v2
- agentic mid-training
- long-horizon reinforcement learning
- BrowseComp
- WideSearch
- DeepSearchQA
- Humanity’s Last Exam
활용 사례
- 전문 업무 흐름의 종단간 자동화
- 실시간 웹사이트 기반 쇼핑·여행·채용·금융 업무
- 여러 Agent가 참여하는 과학 연구와 논문 작성
- 근거 수집과 조건별 검증을 결합한 Deep Research
- 실험 실패 복구와 연구 과정의 반복 개선
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

