MAS-PromptBench: When Does Prompt Optimization Improve Multi-Agent LLM Systems?

발행일
출처
arXiv
논문 번호
475
분야
Machine Learning
arXiv 번호
2606.23664

다중 에이전트 시스템(MAS)에서 시스템 프롬프트 최적화가 언제, 얼마나 효과적인지 체계적으로 벤치마킹한다.

MAS-PromptBench는 다중 에이전트 LLM 시스템에서 프롬프트 최적화 효과를 평가하는 종합 벤치마크다. 5종 워크플로우 토폴로지, 3종 통신 프로토콜, 2~10명 팀 규모를 아우르며, GEPA와 MIPRO 두 최적화 도구를 평가한다. 최대 24점 개선이 가능하지만 최대 16점 하락도 발생하여, 구조화된 통신과 명확한 국소 행동이 있을 때 효과적이고 팀이 커질수록 최적화가 어려워짐을 입증했다.

핵심 요약

  • MAS 프롬프트 최적화 전용 벤치마크: 5종 토폴로지, 3종 통신 프로토콜, 2~10 에이전트 규모
  • 최대 +24점 개선부터 최대 -16점 하락까지 극적인 편차 → 맹목적 적용 위험 입증
  • 구조화된 통신 프로토콜일수록 최적화 효과 큼(Freeform < Semi-structured < Structured)
  • 팀 규모 증가 시 조정 복잡도 상승으로 최적화 효과 감소(2명 +2.4점 → 10명 -2.1점 평균)
  • 단일 에이전트 최적화 도구의 자연스러운 MAS 확장은 충분치 않으며, MAS 맞춤형 알고리즘 필요

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)