Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL

발행일
출처
arXiv
논문 번호
074
분야
Agents / Distillation
arXiv 번호
2508.13167

OPPO AI Agent Team은 단일 대규모 언어 모델(LLM)이 멀티 에이전트 협업을 시뮬레이션해 복잡한 문제를 종단간으로 해결하게 하는 패러다임인 Chain-of-Agents(CoA)를 개발했다.

OPPO AI Agent Team은 단일 대규모 언어 모델(LLM)이 멀티 에이전트 협업을 시뮬레이션해 복잡한 문제를 종단간으로 해결하게 하는 패러다임인 Chain-of-Agents(CoA)를 개발했다. 멀티 에이전트 증류와 에이전트형 강화학습으로 훈련된 이 접근법은 다양한 에이전트형 과제에서 SOTA 성능을 달성하면서, 기존 멀티 에이전트 시스템 대비 추론 비용을 84.6% 절감한다.

핵심 요약

  • 기존 멀티 에이전트 시스템(MAS)은 LLM 백본이 다중 턴 멀티 에이전트 워크플로우에 맞게 본래적으로 훈련되지 않았기 때문에, 높은 계산 오버헤드, 일반화 문제, 종단간 데이터 중심 학습의 부재라는 한계를 겪는다.
  • 기존 도구 통합 추론(TIR) 모델은 경직된 '사고-행동-관찰' 워크플로우에 제약되어, 유연한 멀티 에이전트 협업 패턴을 본래적으로 지원하지 못한다.
  • MAS와 TIR 패러다임 모두 단일 통합 LLM 안에서 복잡하고 동적인 멀티 에이전트 멀티 도구 오케스트레이션을 학습하기 위해 종단간 훈련을 효과적으로 활용하지 못한다.
  • Chain-of-Agents(CoA) 패러다임은 단일 LLM의 디코딩 과정 안에서 멀티 에이전트 협업을 통합하여, 다양한 역할 수행(예: 사고, 계획, 성찰) 에이전트와 도구 에이전트(예: 검색, 크롤, 코드 생성)를 동적으로 활성화한다.
  • 에이전트형 지도 미세조정(SFT) 프레임워크는 전문가 수준의 멀티 에이전트 시스템 궤적을 CoA 호환 훈련 데이터로 증류하며, 점진적 품질 필터링을 사용해 고품질의 복잡한 문제 해결 패턴을 보장한다.
  • 에이전트형 강화학습(RL)은 결과 기반 보상을 통해 LLM의 멀티 도구 오케스트레이션 정책을 추가로 정교화하여, 까다로운 과제 특화 질의에서 전략적 도구 사용과 적응적 추론을 강화한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)