본문으로 건너뛰기

MCP-Bench: MCP 서버 기반 도구 사용 에이전트 벤치

28개 MCP 서버와 250개 도구로 LLM 에이전트의 복합 실무 역량을 평가하는 벤치다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

MCP-Bench는 Model Context Protocol(MCP)을 통해 28개의 라이브 MCP 서버와 250개의 도구를 결합해 실제와 유사한 다단계 도구 사용 과제를 생성하는 벤치마크이다. 도구 수준의 스키마 이해, 궤적 수준의 다중 홉 계획, 최종 작업 완료까지를 포함하는 다면적 평가 프레임워크로 모호한 지시에서의 도구 검색과 교차 도메인 연계 능력을 직접 측정한다. 20개 고급 LLM 실험에서 여전히 도구 검색·계획·중간 출력 기반 접지에 어려움이 관찰돼 도구 사용 에이전트 연구의 개선 여지를 제시했다.

섹션별 상세

MCP-Bench는 현실적이고 다단계인 작업을 평가하기 위해 설계된 벤치마크로서 LLM의 도구 사용 능력을 핵심 목표로 삼았다. 이 벤치마크는 Model Context Protocol(MCP)을 기반으로 LLM과 28개의 라이브 MCP 서버를 연결하고 총 250개의 도구를 조합해 실제와 유사한 워크플로를 구성한다. 기존의 API 기반 벤치마크가 도구 이름을 명시하거나 단순 몇 단계 워크플로에 머문다는 한계를 보완해 도구 검색, 파라미터 제어, 교차도구 조율을 포함한 복합 역량을 시험한다.
평가 체계는 다면적이고 계층적이다. 도구 수준에서는 스키마 이해와 적절한 파라미터 구성 능력을 측정하고 궤적 수준에서는 다중 홉 계획 능력과 단계 간의 중간 출력 활용 능력을 평가하며 최종적으로 작업 완료 여부로 성능을 집계한다. 이러한 구성은 에이전트가 모호한 지시에서 적절한 도구를 선택하고 여러 도구를 연쇄적으로 운영해 실세계 목표를 달성하는지를 직접적으로 측정하게 설계됐다.
MCP 서버 각각은 상호보완적인 도구 집합을 제공해 단일 API 호출로는 모사하기 어려운 복합 입출력 결합을 허용한다. 예컨대 금융·여행·과학 계산·학술 검색 등 서로 다른 도메인의 도구를 연계해 실제 워크플로를 재현할 수 있게 구성했다. 이 설계로 인해 벤치마크 과제는 도구 간 조정, 세밀한 파라미터 제어, 중간 결과 기반의 재계산이 요구되는 현실적 난제를 포함한다.
저자들이 공개한 실험은 20개 고급 LLM을 대상으로 수행됐고 여러 영역에서 지속적인 어려움이 관찰됐다. 특히 명시적 도구명이 없는 모호한 지시에서 관련 도구를 찾아내는 능력과 다단계 계획을 안정적으로 수립하는 능력이 제한적이었다는 결과가 나타났다. 이 관찰은 도구 사용 에이전트 연구가 여전히 계획·검색·접지(grounding) 능력에서 개선 여지가 크다는 근거를 제공한다.

용어 해설

Model Context Protocol (MCP)
MCP는 LLM을 외부 'MCP 서버'에 표준화된 방식으로 연결해 도구 호출과 상태 교환을 중개하는 프로토콜이다. 요청과 응답의 포맷을 규정해 여러 서버의 도구들을 조합한 다단계 워크플로를 구성할 수 있게 한다. MCP는 벤치마크에서 라이브 서버와 도구를 연결해 현실적 상호작용을 재현하는 기반 역할을 한다.
도구 사용 LLM 에이전트(tool-using LLM agents)
도구 사용 LLM 에이전트는 텍스트 입력을 받아 외부 API·서비스(도구)를 호출해 중간 결과를 확보하고 최종 응답을 생성하는 시스템이다. 입력 해석→도구 선택→파라미터 구성→도구 호출→중간 결과 반영의 순서로 동작하며 도구 간 연계와 계획 능력이 성능을 좌우한다. MCP-Bench는 이러한 에이전트의 실제 도구 조율 능력을 평가하는 데 초점을 맞춘다.
궤적 수준 계획(trajectory-level planning)
궤적 수준 계획은 단일 호출이 아니라 여러 도구와 단계에 걸친 실행 경로를 설계하는 능력이다. 에이전트가 목표를 달성하기 위해 어떤 도구를 어떤 순서로, 어떤 입력으로 호출할지 계획하고 중간 출력을 다음 단계의 근거로 삼는 과정이다. MCP-Bench는 이 능력을 평가 항목으로 포함해 다중 홉 작업 성공률을 측정한다.
도구 스키마 이해(tool schema understanding)
도구 스키마 이해는 각 도구가 요구하는 입력 형식과 출력 구조, 제약을 파악해 올바른 파라미터를 구성하는 능력이다. 모호한 지시문에서 적절한 도구와 필드를 찾아 값을 매핑하고 오류를 방지하는 처리가 포함된다. MCP-Bench는 스키마 이해를 도구 수준 평가 항목으로 포함해 실제 호출 성공률과 연결시킨다.

근거 모음

근거
  • MCP-Bench는 28개의 라이브 MCP 서버와 총 250개의 도구를 연결해 현실적인 다단계 과제를 구성한다. 논문 초록의 수치; arXiv 페이지와 DOI 메타데이터에서 서버·도구 개수 명시. 출처
  • 저자들은 20개의 고급 LLM을 대상으로 실험을 수행했고 다중 홉 계획과 모호한 지시에서의 도구 검색 등에서 지속적 어려움이 관찰됐다고 보고했다. 논문 요약의 'Experiments on 20 advanced LLMs reveal persistent challenges' 문구; 결과 세부는 본문 참조 필요. 출처

기술

  • Model Context Protocol (MCP)
  • LLMs
  • MCP servers
  • 도구 조합 기반 워크플로

활용 사례

  • 금융 도구를 연계해 데이터 조회·계산·트랜잭션을 수행하는 복합 작업
  • 여행 예약 흐름에서 항공편 조회·일정 조율·결제 도구를 순차 호출하는 시나리오
  • 과학 연산 도구와 문헌 검색 도구를 결합해 계산 결과를 근거로 논문을 찾는 작업
  • 학술 검색을 포함한 교차 도메인 워크플로 테스트
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 05.수집 2026. 08. 05.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.