Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
- 발행일
- 출처
- arXiv
- 논문 번호
- 978
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.20169
에이전트 하니스(모델을 둘러싼 실행 코드)를 자동 개선할 때 검증 태스크까지 함께 진화시켜, 평가 비용을 67~80% 줄인 최적화 방법 논문이다.
이 논문은 한마디로 에이전트 하니스(모델 주변의 실행 코드)를 반복적으로 고치는 자동 최적화에서, 매번 전체 검증 세트를 다 평가하는 낭비를 없앤 방법이다. 저자들은 후보들 사이에서 성패가 갈리는 '변별력 있는 태스크'에 평가 예산을 집중하고, 뽑은 부분집합으로 전체 점수를 추정해 반복 사이 비교를 공정하게 만들었다. 그 결과 텍스트 분류에서는 평가 예산 7%만으로 전체 탐색과 비슷했고 20%에서는 오히려 능가했다. Terminal-Bench 2.1에서는 20% 예산으로 전체 탐색 성능을 유지하며 전체 탐색 비용을 67~80% 줄였다.
핵심 요약
- 기존 하니스 최적화는 매 반복마다 검증 태스크 전체를 다 평가해 비용이 컸는데, 검증 태스크 선택 자체를 하니스와 함께 진화시키는 문제를 처음 정식화했다.
- 후보 하니스들 간 성패가 엇갈리는 태스크(성공률 분산이 큰 태스크)가 후보를 가리는 데 가장 유익하다는 관찰로, 분산 가중 샘플링을 통해 에이전트 능력 경계 근처에 평가를 집중했다.
- 샘플링 확률을 보정해 부분 평가에서 전체 점수를 추정하므로, 매번 다른 부분집합을 평가해도 반복 사이 비교가 공정하다.
- Terminal-Bench 2.1에서 전체 탐색과 비슷한 최종 성능을 평가 예산 20%로 달성해, 토큰 사용량(예: 741M에서 246M)과 탐색 시간(38.0시간에서 20.5시간)을 크게 줄였다.
- 같은 20% 예산에서 무작위 샘플링보다 최종 성능이 3.3점 높아, '무엇을 평가하느냐'가 효율을 좌우한다는 점을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.