TL;DR
실제 기업 업무의 SOP는 문서에 생략된 배경지식과 모호한 판단, 여러 도구의 순차 사용을 요구해 기존의 단일 능력 중심 에이전트 벤치마크만으로는 안정성을 측정하기 어렵습니다. Amazon Science의 SOP-Bench는 12개 업무 영역에서 2,000개가 넘는 전문가 작성 과제를 실행 가능한 도구와 정답 결과로 묶고, 에이전트의 호출 경로와 최종 결과를 재현 가능하게 채점합니다. 11개 frontier model 실험에서는 최신 모델이 항상 우수하지 않았고, 필요한 6개 도구에 무관한 도구 20개를 더하자 성공률이 거의 절반으로 떨어졌으며, 절차별 최적 모델과 에이전트 조합도 달랐습니다. 쉬운 이메일 분류는 약 10번 중 9번 성공했지만 주행 영상 객체 주석은 약 4번 중 1번에 그쳐, 실제 배포 전 업무별 평가와 사람의 감독 지점을 확인해야 한다는 결론으로 이어집니다.
섹션별 상세
- SOP-Bench는 12개 업무 영역에서 2,000개가 넘는 과제를 제공하며 실제 SOP, 작동하는 도구, 정답 결과를 함께 묶는다. — 도입부의 핵심 요약과 What we built 절의 업무 영역 및 과제 수 설명
- SOP-Bench는 에이전트의 도구 호출과 판단 기록을 정답 결과와 비교해 절차 완료 여부를 재현 가능하게 채점한다. — SOP-Bench evaluation overview 도표 설명과 What we built 절의 실행 기록·ground truth 채점 설명

- ReAct 방식에서 Claude 4.5 계열은 Claude 4 계열보다 낮은 점수를 기록했다. — What we found 절의 Newer is not automatically better 단락
- 필요한 6개 도구에 20개의 무관한 도구를 추가하자 비디오 주석 절차의 성공률이 거의 절반으로 떨어졌다. — What we found 절의 More tools can make an agent worse 단락
- 쉬운 이메일 의도 분류 과제의 정답률은 약 10번 중 9번인 반면 어려운 주행 영상 객체 주석 과제는 약 4번 중 1번이었다. — What we found 절의 No single setup wins everywhere 단락
- ReAct 에이전트는 평균적으로 조금 앞섰지만 13개 절차 실행 중 8개에서만 승리했고 과제당 시간이 약 3분의 1 더 걸렸다. — What we found 절의 How an agent is built matters as much as which model runs inside it 단락
용어 해설
- 표준 운영 절차(Standard Operating Procedure)
- — 조직이 반복 업무를 일관되고 안전하게 처리하도록 정리한 단계별 문서입니다. SOP-Bench에서는 전문가가 작성한 실제 절차를 실행 가능한 과제로 변환해 에이전트의 도구 사용과 최종 판단을 평가합니다.
- 함수 호출(Function Calling)
- — 언어 모델이 정해진 도구나 API의 이름과 인자를 구조화된 형식으로 생성해 외부 기능을 실행하는 방식입니다. SOP-Bench에서는 에이전트가 절차 단계에 맞는 도구를 선택하고 호출하는 경로를 평가합니다.
- ReAct 에이전트(ReAct Agent)
- — 언어 모델이 추론과 행동을 번갈아 수행하며 도구 결과를 다음 판단에 반영하는 에이전트 구조입니다. 이 기사에서는 함수 호출 에이전트와 비교해 절차별 성공률과 실행 시간을 측정합니다.
- 정답 데이터(Ground Truth)
- — 각 과제에서 올바른 결과로 간주되는 사전에 검증된 답과 상태입니다. 에이전트가 생성한 문장을 별도 모델의 주관적 판단으로 채점하지 않고 실제 절차의 정답과 비교하게 합니다.
- 도구 호출 추적(Tool Call Trace)
- — 에이전트가 어떤 도구를 어떤 순서와 인자로 호출했는지 기록한 실행 경로입니다. SOP-Bench는 중간 판단과 최종 구조화 출력까지 함께 남겨 실패가 발생한 절차 단계로 원인을 추적하게 합니다.
기술
- SOP-Bench
- Claude 3.5 Sonnet v2
- Claude 4.5
- Claude 4
- function-calling
- ReAct
- mock APIs
- GitHub
- HuggingFace
활용 사례
- 병원 환자 접수 절차에서 보험 보장과 환자 정보 입력을 순서대로 확인하는 에이전트 평가
- 물류 업무에서 배송물의 위험물 해당 여부를 도구와 함께 판정하는 절차 자동화 평가
- 은행의 신규 기업 고객 확인과 금융 컴플라이언스 절차에 대한 에이전트 검증
- 콘텐츠 조정과 주행 영상 객체 주석처럼 여러 단계와 도구가 필요한 업무의 배포 전 평가
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

