TRINITY: An Evolved LLM Coordinator

발행일
출처
arXiv
논문 번호
209
분야
Machine Learning
arXiv 번호
2512.04695

경량 코디네이터(0.6B 모델과 1만 파라미터 헤드)가 Thinker, Worker, Verifier 역할을 할당해 다양한 LLM 간 협업을 조율하며, 진화 전략으로 최적화된다. LiveCodeBench에서 86.2%를 달성하고 분포 외 과제로도 일반화되며, ICLR 2026에 채택되었다.

TRINITY는 서로 다른 파운데이션 모델을 가중치 병합 없이 추론 시점에 조합하는 경량 코디네이터 프레임워크다. 가중치 병합은 아키텍처 불일치와 폐쇄형 API 때문에 한계가 있는데, TRINITY는 소형 언어 모델(약 0.6B 파라미터)의 은닉 상태와 경량 라우팅 헤드(학습 파라미터는 2만 개 미만)로 구성된 코디네이터가 여러 LLM의 협업을 조율해 이 문제를 우회한다. 코디네이터는 매 턴마다 선택한 LLM에 Thinker, Worker, Verifier 중 하나의 역할을 부여하여, 복잡한 기술 습득을 코디네이터 자신이 아닌 외부 모델에 위임한다. 이진 보상의 신호가 약해 경사 기반 강화학습 최적화가 실패했기 때문에, 분리 가능한 공분산 행렬 적응 진화 전략(separable CMA-ES)으로 코디네이터를 최적화한다. 그 결과 코딩, 수학, 추론, 도메인 지식 전반에서 개별 모델과 기존 멀티 에이전트 기법을 일관되게 능가하고, LiveCodeBench에서 86.2% pass@1로 발표 시점 기준 SOTA를 기록했다. 또한 재학습 없이 AIME, BigCodeBench, MT-Bench, GPQA 등 미학습 과제로 제로샷 일반화하여 GPT-5, Gemini 2.5-Pro, Claude-4-Sonnet 같은 개별 모델을 앞섰다. 성능의 두 요인은 코디네이터 은닉 상태가 입력을 풍부하게 맥락화한다는 점, 그리고 고차원이고 엄격한 예산 제약 하에서 분리 가능한 CMA-ES가 블록-엡실론 분리 가능성을 활용해 강화학습, 모방 학습, 무작위 탐색보다 유리하다는 점이다. ICLR 2026 채택 논문이다.

핵심 요약

  • 핵심 아이디어는 컴팩트한 코디네이터(0.6B LLM과 1만 파라미터 경량 헤드)가 매 턴마다 Thinker, Worker, Verifier 역할을 할당해 여러 LLM에 작업을 위임하는 것이다.
  • 분리 가능한 공분산 행렬 적응 진화 전략(CMA-ES)으로 최적화되어, 고차원성과 엄격한 예산 제약 하에서 RL, 모방 학습, 무작위 탐색을 능가한다.
  • LiveCodeBench 86.2%를 포함한 표준 벤치마크에서 SOTA를 달성하며, 코딩, 수학, 추론, 도메인 지식 전반에 걸쳐 개별 모델 및 기존 멀티 에이전트 기법을 일관되게 능가한다.
  • 코디네이터의 은닉 상태 표현이 풍부한 맥락화를 제공하며, 최적화 지형의 블록-엡실론 분리 가능성이 효율적인 진화 탐색을 가능하게 한다.
  • 과제별 튜닝 없이도 분포 외 과제로 견고하게 일반화된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)