Evo-Bench: Can Language Models Improve Agent Harness?

발행일
출처
arXiv
논문 번호
875
분야
LLMs / NLP
arXiv 번호
2608.09096

이 논문은 LLM이 에이전트 실행 프레임워크(하네스)를 스스로 개선할 수 있는지 평가하는 최초의 벤치마크(Evo-Bench)를 만들었다. 최고 모델은 16.6점 향상으로 사람이 만든 것에 근접했다.

이 논문은 한마디로 LLM이 단순히 주어진 과제를 푸는 게 아니라, 과제를 푸는 방식(실행 프레임워크) 자체를 더 좋게 고칠 수 있는지를 체계적으로 평가했다. Search, Office, General 세 영역에서 9개 프론티어 모델을 테스트했고, GPT-5.6 Sol이 16.6점 향상으로 사람이 만든 베이스라인(47.5)에 근접했다. Search와 General에서는 자율 개선이 사람 설계를 넘기도 했지만, Office에서는 정해진 워크플로우가 필요해서 아쉬웠다.

핵심 요약

  • LLM이 에이전트 하네스(실행 코드)를 자율적으로 개선하는 능력을 평가하는 최초의 벤치마크를 만들었다.
  • 하네스 민감도 기반 과제 선정과 검증/평가 분할로 과적합을 방지하는 엄격한 설계를 도입했다.
  • 9개 프론티어 모델 평가에서 최고 16.6점 향상, 사람 설계 베이스라인에 근접했다.
  • General 영역에서는 자율 진화가 사람 설계를 능가했지만 Office 워크플로우에서는 한계를 보였다.
  • 진화된 하네스가 다른 정책 모델에도 이전 가능한 추론 구조로 작동함을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)