Learning to Orchestrate Agents in Natural Language with the Conductor

발행일
출처
arXiv
논문 번호
171
분야
Agents / Multi-Agent / Orchestration
arXiv 번호
2512.04388

Sakana AI는 자연어 기반 에이전트 워크플로를 생성하여 다양한 워커 LLM을 오케스트레이션하도록 종단간 강화학습으로 훈련된 7B LLM "Conductor"를 소개한다.

Sakana AI는 자연어 기반 에이전트 워크플로를 생성하여 다양한 워커 LLM을 오케스트레이션하도록 종단간 강화학습으로 훈련된 7B LLM "Conductor"를 소개한다. 이 프레임워크는 까다로운 추론 벤치마크에서 LiveCodeBench 83.93%, GPQA-Diamond 87.5%를 포함한 최첨단 성과를 달성하여, 개별 프런티어 모델과 기존 멀티 에이전트 시스템을 크게 능가했다.

핵심 요약

  • 복잡한 과제를 위한 최적의 프롬프트 엔지니어링 전략과 멀티 에이전트 워크플로를 수작업으로 설계하는 것은 시간이 많이 들고 어렵다.
  • 어떤 단일 모델도 보편적으로 최적이지 않기 때문에, 다양한 LLM의 특화된 강점을 효과적으로 활용하기는 어렵다.
  • 기존의 멀티 에이전트 협응 방식은 사람이 설계한 스캐폴드, 사전 정의된 라우팅, 고정된 도구 사용 패턴에 의존하는 경우가 많아 유연성과 적응성이 제한된다.
  • Conductor라는 7B LLM은 종단간 강화학습(GRPO 알고리즘)으로 훈련되어, 워커 LLM과 하위 과제와 통신 패턴을 명시하는 에이전트 워크플로를 자연어로 생성한다.
  • Conductor는 일곱 개의 강력한 워커 LLM으로 구성된 다양한 풀(상용 및 오픈소스)을, 문제를 동적으로 분해하고 맞춤형 지시와 함께 목표 하위 과제를 위임함으로써 오케스트레이션한다.
  • 이 프레임워크는 재귀적 자기 호출을 포함한 유연한 통신 토폴로지의 출현을 허용하여, 테스트 시점에 협응 전략의 동적 개선과 적응적 자원 할당을 가능하게 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)