Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

발행일
출처
arXiv
논문 번호
978
분야
LLMs / NLP
arXiv 번호
2608.20169

에이전트 하니스(모델을 둘러싼 실행 코드)를 자동 개선할 때 검증 태스크까지 함께 진화시켜, 평가 비용을 67~80% 줄인 최적화 방법 논문이다.

이 논문은 한마디로 에이전트 하니스(모델 주변의 실행 코드)를 반복적으로 고치는 자동 최적화에서, 매번 전체 검증 세트를 다 평가하는 낭비를 없앤 방법이다. 저자들은 후보들 사이에서 성패가 갈리는 '변별력 있는 태스크'에 평가 예산을 집중하고, 뽑은 부분집합으로 전체 점수를 추정해 반복 사이 비교를 공정하게 만들었다. 그 결과 텍스트 분류에서는 평가 예산 7%만으로 전체 탐색과 비슷했고 20%에서는 오히려 능가했다. Terminal-Bench 2.1에서는 20% 예산으로 전체 탐색 성능을 유지하며 전체 탐색 비용을 67~80% 줄였다.

핵심 요약

  • 기존 하니스 최적화는 매 반복마다 검증 태스크 전체를 다 평가해 비용이 컸는데, 검증 태스크 선택 자체를 하니스와 함께 진화시키는 문제를 처음 정식화했다.
  • 후보 하니스들 간 성패가 엇갈리는 태스크(성공률 분산이 큰 태스크)가 후보를 가리는 데 가장 유익하다는 관찰로, 분산 가중 샘플링을 통해 에이전트 능력 경계 근처에 평가를 집중했다.
  • 샘플링 확률을 보정해 부분 평가에서 전체 점수를 추정하므로, 매번 다른 부분집합을 평가해도 반복 사이 비교가 공정하다.
  • Terminal-Bench 2.1에서 전체 탐색과 비슷한 최종 성능을 평가 예산 20%로 달성해, 토큰 사용량(예: 741M에서 246M)과 탐색 시간(38.0시간에서 20.5시간)을 크게 줄였다.
  • 같은 20% 예산에서 무작위 샘플링보다 최종 성능이 3.3점 높아, '무엇을 평가하느냐'가 효율을 좌우한다는 점을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)