On the Reliability Limits of LLM-Based Multi-Agent Planning

발행일
출처
arXiv
논문 번호
135
분야
Multi-Agent / Theory
arXiv 번호
2603.26993

다중 에이전트 워크플로는 비중복 정보를 추가하거나 통신을 통해 사후 신념을 보존할 때에만 도움이 된다고 주장하는 의사결정 이론 노트다.

이 논문은 LLM 다중 에이전트 계획을, 제한된 언어 채널 하에서 통신하며 도구나 사람의 검토를 사용할 수 있는 노드들로 이루어진 유한 비순환 위임 의사결정 네트워크로 모델링한다. 주요 이론적 결과는, 새로운 외생 신호가 없다면 그러한 위임은 동일한 증거를 가진 중앙집중식 베이즈 의사결정자에게 지배된다는 것이다. 공통 증거의 경우, 그래프 설계는 공유 신호의 예산 제약 확률적 인코더를 선택하는 문제로 환원된다. 통신 손실은 적정 점수 규칙 하의 사후 분포 왜곡으로 특징지어지며, 로그 손실에서는 조건부 상호정보량으로, Brier 점수에서는 제곱 사후 오차로 나타난다. 통제 실험이 이 이론을 뒷받침한다. 직렬 산문 중계는 정확도를 급격히 떨어뜨리고, 구조화된 사후 벡터 메시지는 손실을 줄이며, 도구는 합성 지식베이스 과제에서처럼 비중복 정보를 제공할 때에만 도움이 된다.

핵심 요약

  • 에이전트, 메시지, 비공개 도구 신호, 종단 행동, 선택적 사람 에스컬레이션을 planner나 critic 같은 역할 이름이 아니라 하나의 베이즈 위험 프레임워크 안에서 모델링한다.
  • 신뢰도 상한을 증명한다. 새로운 외생 정보가 없는 경우, 추가 에이전트 단계는 공유 증거를 변환하거나 압축할 수 있을 뿐, 그 증거를 가진 중앙집중식 베이즈 의사결정자를 이길 수 없다.
  • 에이전트 간 산문을 손실 통신 채널로 규정한다. 관련 설계 지표는 에이전트 수나 라운드 수, 전사 길이가 아니라 사후 분포 왜곡이다.
  • 실험은 큰 중계 성능 저하를 보여준다. gpt-4.1-mini는 단일 에이전트 정확도 90.7%에서 중계 에이전트 둘일 때 41.2%, 셋일 때 43.5%, 다섯일 때 22.5%로 떨어지는 반면, 사후 벡터 통신은 정합된 부분집합에서 산문의 58.1% 대비 75.2%에 도달한다.
  • 도구 사용은 정보 구조를 바꿀 때에만 가치가 있다. Wikipedia 접근은 MMLU에서 대체로 중복이지만, 합성 KB 조회는 도구가 없을 때의 24.3%에서 82.7%로 정확도를 끌어올린다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)