LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries

발행일
출처
arXiv
논문 번호
086
분야
Benchmarks / Agents
arXiv 번호
2508.15760

Duke University와 Zoom Video Communications의 연구진이 복잡하고 동적인 도구 사용 과제에 대해 AI 에이전트를 평가하는 벤치마크 LiveMCP-101을 발표했다.

Duke University와 Zoom Video Communications의 연구진이 복잡하고 동적인 도구 사용 과제에 대해 AI 에이전트를 평가하는 벤치마크 LiveMCP-101을 발표했다. 이 연구는 최첨단 대형 언어 모델조차 과제 성공률이 60% 미만에 그치며, 그 원인이 흔히 의미론적 매개변수 오류와 현실적 환경에서 여러 도구를 조율하는 데 따르는 어려움에 있음을 보여준다.

핵심 요약

  • AI 에이전트는 유망한 프로토타입 성능을 보이지만, 실제 동적 운영 환경에 배포되면 신뢰성과 견고성이 부족하다.
  • 도구로 보강된 LLM을 위한 기존 벤치마크는 단일 단계 도구 호출만 평가하거나, 합성 환경에서 동작하거나, 낮은 과제 복잡도에 집중하는 한계가 있어 실제 도구 상호작용의 복잡성을 포착하지 못한다.
  • 다양하고 시간에 따라 변화하는 외부 도구를 다루는 에이전트의 구체적인 실패 양상을 진단할 명확한 프레임워크가 없었다.
  • 다양한 MCP 지원 도구를 다단계로 조율해 사용해야 하는, 신중하게 선별된 101개의 실세계 질의로 벤치마크 LiveMCP-101을 구성했다.
  • 정답 실행 계획과 병렬 실시간 실행을 활용해 라이브 MCP 도구 응답의 동적이고 진화하는 특성을 반영하는 새로운 평가 방법론을 제안했다.
  • 인간 전문가가 검증한 LLM-as-a-judge 방식을 활용해 최종 출력과 에이전트의 실행 궤적 모두에 세밀한 점수를 제공했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)