본문으로 건너뛰기

SOP-Bench, 실제 업무 절차용 에이전트 평가 기준

SOP-Bench가 실제 업무 절차에서 에이전트의 도구 사용과 판단을 정답 기반으로 평가합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

실제 기업 업무의 SOP는 문서에 생략된 배경지식과 모호한 판단, 여러 도구의 순차 사용을 요구해 기존의 단일 능력 중심 에이전트 벤치마크만으로는 안정성을 측정하기 어렵습니다. Amazon Science의 SOP-Bench는 12개 업무 영역에서 2,000개가 넘는 전문가 작성 과제를 실행 가능한 도구와 정답 결과로 묶고, 에이전트의 호출 경로와 최종 결과를 재현 가능하게 채점합니다. 11개 frontier model 실험에서는 최신 모델이 항상 우수하지 않았고, 필요한 6개 도구에 무관한 도구 20개를 더하자 성공률이 거의 절반으로 떨어졌으며, 절차별 최적 모델과 에이전트 조합도 달랐습니다. 쉬운 이메일 분류는 약 10번 중 9번 성공했지만 주행 영상 객체 주석은 약 4번 중 1번에 그쳐, 실제 배포 전 업무별 평가와 사람의 감독 지점을 확인해야 한다는 결론으로 이어집니다.

섹션별 상세

기존 AI 에이전트 벤치마크는 API 선택, 제약 준수, 계획 수립처럼 단일 능력을 깨끗한 형식의 프롬프트로 측정해 실제 업무 절차의 모호성과 단계 간 의존성을 놓칩니다. 실제 SOP 실행에는 여러 도구를 순서대로 조정하고 이전 행동을 기억하며 예외 상황에서 회복하는 능력이 함께 필요합니다. SOP-Bench는 전문가가 작성한 현실적인 절차에 도구 호출과 정답 결과를 결합해 텍스트 생성이 아니라 절차 완료 자체를 평가하도록 설계됐습니다.
SOP-Bench는 의료 접수, 위험물 분류, 고객 서비스, 콘텐츠 조정, 금융 컴플라이언스, 창고 검사 등을 포함한 12개 업무 영역에서 2,000개가 넘는 과제를 제공합니다. 각 과제는 SOP 본문, 호출 가능한 도구와 사양, 테스트 사례 및 정답 결과로 구성되며 에이전트는 도구를 호출해 최종 구조화 출력을 만들어야 합니다. 실행 과정의 도구 호출과 판단 기록을 정답과 대조하므로 팀은 자체 에이전트를 실제 절차에 투입하기 전에 성공 여부와 실패 지점을 재현 가능하게 확인할 수 있습니다.
근거
  • SOP-Bench는 12개 업무 영역에서 2,000개가 넘는 과제를 제공하며 실제 SOP, 작동하는 도구, 정답 결과를 함께 묶는다. 도입부의 핵심 요약과 What we built 절의 업무 영역 및 과제 수 설명
  • SOP-Bench는 에이전트의 도구 호출과 판단 기록을 정답 결과와 비교해 절차 완료 여부를 재현 가능하게 채점한다. SOP-Bench evaluation overview 도표 설명과 What we built 절의 실행 기록·ground truth 채점 설명
벤치마크 구축에서는 도메인 전문가가 실제 산업 업무의 절차와 과제 맥락을 작성하고, Anthropic Claude 3.5 Sonnet v2가 스키마와 모의 API, 도구 사양 및 코드, 일반 사례와 예외·실패 사례가 섞인 데이터를 생성했습니다. 이후 전문가가 생성물의 논리와 데이터를 검수하고 코드 실행 결과까지 확인해 정답을 확정했으며, 모든 단계에서 독점 데이터나 민감 정보는 사용하지 않았습니다. 이 사람과 AI의 분업은 여러 산업의 모호한 SOP를 실행 가능한 과제로 확장하면서도 평가 기준을 전문가의 판단에 고정하는 방식입니다.
전문가가 작성한 모호한 SOP를 실행 가능한 과제로 바꾸고, 모의 도구를 호출하는 LLM Agent의 실행 궤적을 정답 기반 지표로 평가하는 SOP-Bench의 전체 흐름도입니다.
Diagram왼쪽에서 실제 산업 영역의 전문가 작성 SOP가 자연어 지시, 구조화된 입출력, 도구 및 API 사양, 정답 결과를 가진 실행 과제로 변환됩니다. 중앙의 LLM Agent는 mock tools와 APIs를 호출하며 도구 호출 추적, 중간 판단, 최종 구조화 출력을 남기고, 오른쪽에서는 실행 완료율과 과제 성공률 계열 지표를 이용해 성능과 실패 원인을 평가합니다. 따라서 이 도표는 단일 프롬프트 능력보다 절차 전체의 도구 사용과 결과 검증을 측정한다는 기사의 핵심 방법론과 직접 연결됩니다.
11개 frontier model과 함수 호출 에이전트 및 ReAct 방식 에이전트를 비교한 결과, 최신 모델이 항상 더 높은 성능을 내지는 않았습니다. ReAct 방식에서는 Claude 4.5 계열이 Claude 4 계열보다 낮은 점수를 기록했고, 필요한 6개 도구에 무관한 도구 20개를 추가하자 비디오 주석 절차의 성공률이 거의 절반으로 떨어졌습니다. 모델과 에이전트의 조합은 절차마다 달랐으므로 배포 전에는 모델 교체나 도구 추가를 실제 업무 과제로 다시 검증해야 합니다.
근거
  • ReAct 방식에서 Claude 4.5 계열은 Claude 4 계열보다 낮은 점수를 기록했다. What we found 절의 Newer is not automatically better 단락
  • 필요한 6개 도구에 20개의 무관한 도구를 추가하자 비디오 주석 절차의 성공률이 거의 절반으로 떨어졌다. What we found 절의 More tools can make an agent worse 단락
절차 난이도에 따른 성능 격차도 컸으며, 이메일 의도 분류처럼 쉬운 과제에서는 에이전트가 약 10번 중 9번 정답에 도달했지만 주행 영상 객체 주석처럼 어려운 과제에서는 약 4번 중 1번만 맞혔습니다. 같은 모델을 사용해도 ReAct 에이전트는 평균적으로 조금 앞섰지만 13개 절차 실행 중 8개에서만 승리했고 과제당 시간이 약 3분의 1 더 걸렸습니다. 판단 지점이 많은 절차보다 읽기 구간이 긴 절차에서 성능이 더 낮게 나타난 사례도 있어, 단일 평균 점수만으로 배포 가능성을 판단하기 어렵습니다.
근거
  • 쉬운 이메일 의도 분류 과제의 정답률은 약 10번 중 9번인 반면 어려운 주행 영상 객체 주석 과제는 약 4번 중 1번이었다. What we found 절의 No single setup wins everywhere 단락
  • ReAct 에이전트는 평균적으로 조금 앞섰지만 13개 절차 실행 중 8개에서만 승리했고 과제당 시간이 약 3분의 1 더 걸렸다. What we found 절의 How an agent is built matters as much as which model runs inside it 단락
공개된 SOP-Bench에는 12개 전문가 작성 절차, 생성된 도구와 데이터셋, 두 가지 기준 에이전트, 정답 기반 평가 코드가 포함됩니다. 연구자와 개발팀은 기존 절차에 자체 에이전트를 연결하거나 같은 사람과 AI의 구축 방식을 이용해 새로운 산업 영역을 추가할 수 있습니다. 향후에는 이미지와 표가 포함된 지시문, 중첩 구조로 중간에 문맥을 전환해야 하는 절차, 같은 업무의 더 어려운 변형이 확장 대상으로 제시됐습니다.

용어 해설

표준 운영 절차(Standard Operating Procedure)
조직이 반복 업무를 일관되고 안전하게 처리하도록 정리한 단계별 문서입니다. SOP-Bench에서는 전문가가 작성한 실제 절차를 실행 가능한 과제로 변환해 에이전트의 도구 사용과 최종 판단을 평가합니다.
함수 호출(Function Calling)
언어 모델이 정해진 도구나 API의 이름과 인자를 구조화된 형식으로 생성해 외부 기능을 실행하는 방식입니다. SOP-Bench에서는 에이전트가 절차 단계에 맞는 도구를 선택하고 호출하는 경로를 평가합니다.
ReAct 에이전트(ReAct Agent)
언어 모델이 추론과 행동을 번갈아 수행하며 도구 결과를 다음 판단에 반영하는 에이전트 구조입니다. 이 기사에서는 함수 호출 에이전트와 비교해 절차별 성공률과 실행 시간을 측정합니다.
정답 데이터(Ground Truth)
각 과제에서 올바른 결과로 간주되는 사전에 검증된 답과 상태입니다. 에이전트가 생성한 문장을 별도 모델의 주관적 판단으로 채점하지 않고 실제 절차의 정답과 비교하게 합니다.
도구 호출 추적(Tool Call Trace)
에이전트가 어떤 도구를 어떤 순서와 인자로 호출했는지 기록한 실행 경로입니다. SOP-Bench는 중간 판단과 최종 구조화 출력까지 함께 남겨 실패가 발생한 절차 단계로 원인을 추적하게 합니다.

기술

  • SOP-Bench
  • Claude 3.5 Sonnet v2
  • Claude 4.5
  • Claude 4
  • function-calling
  • ReAct
  • mock APIs
  • GitHub
  • HuggingFace

활용 사례

  • 병원 환자 접수 절차에서 보험 보장과 환자 정보 입력을 순서대로 확인하는 에이전트 평가
  • 물류 업무에서 배송물의 위험물 해당 여부를 도구와 함께 판정하는 절차 자동화 평가
  • 은행의 신규 기업 고객 확인과 금융 컴플라이언스 절차에 대한 에이전트 검증
  • 콘텐츠 조정과 주행 영상 객체 주석처럼 여러 단계와 도구가 필요한 업무의 배포 전 평가
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.