Agent-as-a-Router: Agentic Model Routing for Coding Tasks

발행일
출처
arXiv
논문 번호
481
분야
AI / General
arXiv 번호
2606.22902

LLM 라우팅의 병목이 추론 능력이 아니라 '정보 부족'임을 증명하고, Context-Action-Feedback 루프를 통해 실행 기반 경험을 축적하는 적응형 라우터 ACRouter를 제안한다.

다수 LLM 중 최적 모델을 선택하는 라우팅 문제에서 성능 병목이 추론 능력이 아니라 정보 부족(information deficit)임을 발견했다. 성능 통계를 제공하면 15.3% 향상을 보인다. 이를 바탕으로 Context→Action→Feedback 루프를 통해 실행 기반 경험을 축적하는 ACRouter를 제안하며, ~10K 태스크와 8개 프론티어 LLM으로 구성한 CodeRouterBench에서 최저 누적 후회(cumulative regret)를 달성했다.

핵심 요약

  • LLM 라우터의 성능 병목은 추론 능력 부족이 아니라 정보 부족(information deficit)임을 실험으로 입증
  • 성능 통계 제공 시 15.3% 상대 향상으로 heuristic 라우터보다 뛰어남
  • Context-Action-Feedback(C-A-F) 루프를 통해 스트리밍 태스크에서 실행 기반 경험을 지속적으로 축적
  • ACRouter는 in-distribution에서 49.98% AvgPerf, OOD agentic programming에서 62.50% AvgPerf 달성
  • 정적 라우터(분류기, 밴딧)는 OOD에서 성능이 급락하지만 ACRouter는 일반화 유지
  • CodeRouterBench: ~10K 태스크, 8개 LLM, 실행 검증된 점수를 제공하는 후회 기반 라우터 평가 환경

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)