Streaming Communication in Multi-Agent Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 310
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.05158
다중 에이전트 추론 시스템은 종단 간 지연 시간이 파이프라인 깊이에 비례해 선형적으로 증가하도록 강제하는 '생성 후 전달' 패러다임을 채택한다.
기존 다중 에이전트 추론은 한 에이전트가 전체 답을 만든 뒤 다음 에이전트에 넘겨 파이프라인이 길수록 지연도 늘어난다. StreamMA는 각 추론 단계를 생성되는 즉시 다음 에이전트에 보내 인접 작업을 겹쳐 실행한다. 초반 추론 단계가 후반보다 더 믿을 만한 경향이 있어, 완성된 긴 사슬의 늦은 오류가 다음 에이전트를 흐리는 것도 줄일 수 있다는 설명을 제시한다. 수학, 과학, 코드의 여덟 벤치마크와 두 모델, 세 연결 구조에서 직렬 방식과 단일 에이전트보다 평균 7.3%포인트, 최대 22.4%포인트 높았다. 또한 에이전트마다 처리하는 단계 수를 늘리면 성능과 효율이 함께 좋아지는 단계 수준 확장 법칙을 보고했다.
핵심 요약
- 이 논문은 생성되는 즉시 각 추론 단계를 하위 에이전트로 스트리밍하여 인접 에이전트를 파이프라이닝함으로써 지연 시간을 줄이는 다중 에이전트 추론 시스템 StreamMA를 소개한다.
- 수학, 과학, 코드를 아우르는 8개 추론 벤치마크, 두 개의 최첨단 LLM(Claude Opus 4.6과 GPT-5.4), 세 가지 토폴로지(Chain, Tree, Graph)에 걸쳐 StreamMA는 두 베이스라인을 모두 능가한다.
- 이러한 기여를 넘어, 저자들은 '단계 수준 스케일링 법칙'을 발견했다. 즉, 에이전트당 단계 수를 늘리면 효과성과 효율성이 일관되게 향상되며, 이는 에이전트 수 스케일링과 직교하고 조합 가능한 새로운 스케일링 차원이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.