728x90
반응형

 

 

2025.8.15
[MCPToolBench++: A Large Scale AI Agent Model Context Protocol MCP Tool Use Benchmark] 

이 논문은 대규모 AI 에이전트의 도구 활용 능력을 정밀하게 측정하기 위한 새로운 벤치마크인 MCPToolBench++를 소개합니다. 연구진은 파편화된 도구 사용 환경을 통합하는 Model Context Protocol(MCP)을 기반으로 4,000개 이상의 서버에서 추출한 방대한 데이터셋을 구축하여, 기존 평가 체계가 가졌던 데이터 부족 및 복잡한 응답 처리의 한계를 극복하고자 했습니다. 이 벤치마크는 단순한 일회성 호출을 넘어 최대 10단계에 이르는 다단계 도구 체인(multi-step tool chains)과 다국어 환경을 지원하며, 추상 구문 트리(AST)와 실행 성공률을 결합한 다각적인 지표로 모델의 실질적인 성능을 진단합니다. 결과적으로 이 기술서는 최신 거대언어모델(LLM)들의 도구 선택 및 매개변수 추론 능력을 엄격히 검증하고, 에이전트 시스템의 실제 구동 환경에서 발생하는 오류의 근본 원인을 분석하여 미래 AI 에이전트 설계에 중요한 이정표를 제시합니다.

 

 

 

 

 

Overview

이 논문은 "MCPToolBench++" 라는 벤치마크를 제안합니다. LLM의 능력은 함수 호출(function call)을 통해 다양한 데이터 소스나 API 결과를 컨텍스트 창에 통합함으로써 강화되며, 검색, 웹 크롤러, 지도, 금융 데이터, 파일 시스템, 브라우저 사용 등이 대표적인 도구다. 이런 데이터 소스나 기능을 통합하려면 표준화된 방법이 필요한데, Model Context Protocol(MCP)이 LLM에 컨텍스트를 제공하는 표준화된 방식을 제공한다. 이 벤치마크는 2025년 7월 기준 40개 이상의 카테고리에 걸친 4,000개 이상의 MCP 서버로 구성된 마켓플레이스를 기반으로 구축되었으며, 단일 단계(single-step)와 다단계(multi-step) 도구 호출로 이루어진 데이터셋을 포함한다.

Background

기존 MCP 도구 호출 평가에는 다음과 같은 문제들이 있었습니다.

  1. 포괄적 벤치마크 부재: 다양한 MCP 도구와 스키마를 포괄할 수 없고, 데이터 소스·도구 스키마·서버 설정에 대한 통합 인덱스가 마켓플레이스 전반에 부재하다.
  2. 파라미터 추론의 어려움: 기존 파라미터들은 주가 티커(MSFT→Microsoft), 이동 수단 코드, 지오코드 등 코드·약어에 대한 추론을 LLM에 요구한다.
  3. 다양한 응답 형식 평가의 어려움: MCP API 응답과 사용자 질의의 다양성은 단순 텍스트나 이미지를 넘어서기 때문에 결과 평가의 복잡성이 커진다. 예컨대 브라우저 사용 MCP의 스크린샷 저장이나 PayPal의 인보이스 생성 URL 반환 같은 경우입니다.
  4. 성공률 편차와 위험: 일부 MCP는 안정적인 서비스를 제공하지만, 다른 것들은 신뢰도가 낮거나 프롬프트 공격·개인정보 유출 위험이 있다.

이를 해결하기 위해 검색, 지도, 금융, 결제, 자동 브라우저 사용, 파일 시스템 등 6개 도메인의 MCP 서버를 포괄하는 1.5K개의 질의-응답 쌍으로 구성된 벤치마크를 도입했으며, 일부 다단계 질문은 하나의 사용자 요청에서 최대 10개의 도구를 사용한다.

Methods

데이터 준비 파이프라인은 크게 4단계로 구성됩니다.

  • MCP 서버·스키마 수집: smithery.ai, deepnlp.org, pulsemcp.com, modelscope.cn 등 오픈 MCP 마켓플레이스에서 서버를 수집하고, mcp-marketplace Python SDK를 이용해 카테고리별로 스키마 JSON 파일을 검색·필터링한다.
  • Tool Sampler: 단일 단계 호출은 동일 확률의 복원추출로, 다단계 호출은 카테고리 내 비복원추출로 2~10개(K=10) 도구 체인을 샘플링합니다. 서로 다른 카테고리를 넘나드는 질의의 경우에는 LLM으로 의미 있는 카테고리 조합(예: 금융+차트, 검색+지도)을 먼저 생성한 뒤 동일한 샘플링 전략을 적용한다.
  • Query Generator: 도구 호출 템플릿 생성, 파라미터 값 생성, 슬롯 채우기, 질의 재작성의 연속된 단계로 구성되며, 지오코드나 주가 심볼 같은 코드가 필요한 경우 코드 사전(code dictionary)을 LLM 컨텍스트에 제공한다.
  • 후처리 및 검증: 의미론적 검사(semantic check)와 합리성 검사(reasonableness check)를 거쳐 잘못 재작성되었거나 반사실적인(counterfactual) 질의를 제거한다 (예: "뉴욕에서 도쿄까지 기차로 여행하는 방법"은 지리적으로 불가능하므로 제거).

또한 평가 지표로 함수 매치, 필수 파라미터 매치, 파라미터 타입·값 매치를 비교하는 Abstract Syntax Tree(AST) 지표와, 다단계 실행 계획을 방향성 비순환 그래프(DAG)로 평가하는 AST DAG-Accuracy, 그리고 실제 도구 실행 결과의 정합성을 측정하는 Pass@K를 사용했다.

Experiments

OpenAI, Claude, Qwen, Kimi 등 다양한 SOTA 모델의 MCP 함수 호출 능력을 벤치마크에서 평가했으며, 영어·중국어·프랑스어·러시아어 등 다국어 지원과 단일/다단계 호출, 다양한 카테고리(검색, 브라우저, 지도 등)로 성능을 구분해 살펴봤다.

주요 결과:

  • AST 점수 기준으로 Qwen3-coder가 브라우저와 지도 카테고리에서, Qwen2.5-max가 파일 시스템과 금융 카테고리에서, Kimi-K2-Instruct가 검색과 결제 카테고리에서 최고 성능을 보였다.
  • Pass@1 기준으로는 Qwen3-coder가 브라우저에서, Qwen2.5-max가 파일 시스템에서, Claude-3.7-Sonnet이 검색에서, GPT-4o가 지도와 금융에서, Kimi-K2-Instruct가 결제에서 1위를 기록했다.
  • 흥미로운 발견으로, 검색 카테고리에서 Claude-3.7-Sonnet은 AST 점수(0.728)로 Kimi-K2-Instruct(0.732)에 이어 2위였지만, 실제 도구 실행 후 Pass@1에서는 Claude-3.7-Sonnet(0.620)이 Kimi-K2-Instruct(0.368)를 크게 앞섰다. 이는 Google Custom Search 도구가 Tavily 같은 다른 MCP 검색 도구 제공자보다 성공률이 높고, Claude-3.7-Sonnet이 다른 모델보다 google-search를 더 자주 선택했기 때문이라고 분석합니다.
  • 오류 원인 분석 결과, 지도(MAP) 도메인에서는 LLM이 추론한 위경도 값이 범위를 벗어나는 오류가, 브라우저 사용 도메인에서는 존재하지 않는 로컬 파일 경로에 스크린샷을 저장하려는 오류가, 검색 도메인에서는 URL 처리 오류가 대표적으로 나타났다.

Conclusion

이 논문은 LLM과 AI 에이전트가 MCP 도구를 올바르게 사용하는 능력을 평가하기 위해 MCPToolBench++ 벤치마크를 소개했으며, 이는 다도메인·다국어를 지원하는 광범위한 실세계 도구 카테고리를 포괄한다. 벤치마크 준비를 확장하기 위해 오픈 MCP 마켓플레이스에서 수집한 설정과 도구 스키마를 기반으로 한 자동 파이프라인을 도입했고, 여러 SOTA 모델을 평가했으며, 향후 개선점을 제시하기 위해 도구 호출 성공률과 오류 근본 원인에 대한 상세 분석을 수행했다.

 

 

728x90
Posted by Mr. Slumber
,