Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets
- 발행일
- 출처
- arXiv
- 논문 번호
- 138
- 분야
- Agents / Multi-Agent
- arXiv 번호
- 2604.02460
이 Stanford University 연구는 다중 홉 추론 과제에서 단일 에이전트 대 다중 에이전트 LLM 시스템의 성능을 조사한다.
이 Stanford University 연구는 다중 홉 추론 과제에서 단일 에이전트 대 다중 에이전트 LLM 시스템의 성능을 조사한다. 사고 토큰 예산이 동일할 때 단일 에이전트 시스템이 일관되게 다중 에이전트 시스템과 대등하거나 능가하며, 다중 에이전트 시스템은 주로 심각한 컨텍스트 저하 조건에서만 이점을 제공할 수 있음을 보여준다.
핵심 요약
- 다중 에이전트 LLM 시스템(MAS)의 성능 향상이 구조적 이점 때문인지, 단순히 테스트 시점의 연산 지출 증가 때문인지 불분명하다.
- MAS와 단일 에이전트 시스템(SAS) 간의 기존 비교는 불균등한 토큰 사용량으로 혼란되는 경우가 많아 직접 비교를 신뢰하기 어렵다.
- 성능 동인을 명확히 하려면 사고 토큰 예산을 엄밀히 통제하는 견고한 평가 방법론이 필요하다.
- 고정된 추론 예산 하에서 단일 에이전트 시스템의 정보 효율성을 주장하기 위해 데이터 처리 부등식(Data Processing Inequality, DPI)에 기반한 이론적 프레임워크를 도입했다.
- 세 가지 LLM 계열(Qwen3, DeepSeek, Gemini)에 걸쳐 다양한 단일 에이전트 및 다중 에이전트 구조(예: Sequential, Debate, Ensemble)를 다중 홉 추론 과제(FRAMES, MuSiQue)에서 광범위하게 실증 평가했다.
- 시스템 간 공정한 비교를 보장하기 위해 사고 토큰 예산, 즉 프롬프트와 최종 답을 제외한 중간 추론용 토큰에 대한 엄격한 통제를 구현했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.