LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries
- 발행일
- 출처
- arXiv
- 논문 번호
- 086
- 분야
- Benchmarks / Agents
- arXiv 번호
- 2508.15760
Duke University와 Zoom Video Communications의 연구진이 복잡하고 동적인 도구 사용 과제에 대해 AI 에이전트를 평가하는 벤치마크 LiveMCP-101을 발표했다.
Duke University와 Zoom Video Communications의 연구진이 복잡하고 동적인 도구 사용 과제에 대해 AI 에이전트를 평가하는 벤치마크 LiveMCP-101을 발표했다. 이 연구는 최첨단 대형 언어 모델조차 과제 성공률이 60% 미만에 그치며, 그 원인이 흔히 의미론적 매개변수 오류와 현실적 환경에서 여러 도구를 조율하는 데 따르는 어려움에 있음을 보여준다.
핵심 요약
- AI 에이전트는 유망한 프로토타입 성능을 보이지만, 실제 동적 운영 환경에 배포되면 신뢰성과 견고성이 부족하다.
- 도구로 보강된 LLM을 위한 기존 벤치마크는 단일 단계 도구 호출만 평가하거나, 합성 환경에서 동작하거나, 낮은 과제 복잡도에 집중하는 한계가 있어 실제 도구 상호작용의 복잡성을 포착하지 못한다.
- 다양하고 시간에 따라 변화하는 외부 도구를 다루는 에이전트의 구체적인 실패 양상을 진단할 명확한 프레임워크가 없었다.
- 다양한 MCP 지원 도구를 다단계로 조율해 사용해야 하는, 신중하게 선별된 101개의 실세계 질의로 벤치마크 LiveMCP-101을 구성했다.
- 정답 실행 계획과 병렬 실시간 실행을 활용해 라이브 MCP 도구 응답의 동적이고 진화하는 특성을 반영하는 새로운 평가 방법론을 제안했다.
- 인간 전문가가 검증한 LLM-as-a-judge 방식을 활용해 최종 출력과 에이전트의 실행 궤적 모두에 세밀한 점수를 제공했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.