MAS-PromptBench: When Does Prompt Optimization Improve Multi-Agent LLM Systems?
- 발행일
- 출처
- arXiv
- 논문 번호
- 475
- 분야
- Machine Learning
- arXiv 번호
- 2606.23664
다중 에이전트 시스템(MAS)에서 시스템 프롬프트 최적화가 언제, 얼마나 효과적인지 체계적으로 벤치마킹한다.
MAS-PromptBench는 다중 에이전트 LLM 시스템에서 프롬프트 최적화 효과를 평가하는 종합 벤치마크다. 5종 워크플로우 토폴로지, 3종 통신 프로토콜, 2~10명 팀 규모를 아우르며, GEPA와 MIPRO 두 최적화 도구를 평가한다. 최대 24점 개선이 가능하지만 최대 16점 하락도 발생하여, 구조화된 통신과 명확한 국소 행동이 있을 때 효과적이고 팀이 커질수록 최적화가 어려워짐을 입증했다.
핵심 요약
- MAS 프롬프트 최적화 전용 벤치마크: 5종 토폴로지, 3종 통신 프로토콜, 2~10 에이전트 규모
- 최대 +24점 개선부터 최대 -16점 하락까지 극적인 편차 → 맹목적 적용 위험 입증
- 구조화된 통신 프로토콜일수록 최적화 효과 큼(Freeform < Semi-structured < Structured)
- 팀 규모 증가 시 조정 복잡도 상승으로 최적화 효과 감소(2명 +2.4점 → 10명 -2.1점 평균)
- 단일 에이전트 최적화 도구의 자연스러운 MAS 확장은 충분치 않으며, MAS 맞춤형 알고리즘 필요
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.