HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
- 발행일
- 출처
- arXiv
- 논문 번호
- 840
- 분야
- AI / General
- arXiv 번호
- 2608.06301
LLM이 다른 에이전트의 하네스(프롬프트·도구·제어흐름)를 자동으로 개선하는 능력을 측정하는 벤치마크를 제안했다.
이 논문은 한마디로 'AI가 다른 AI 시스템의 코드(하네스)를 얼마나 잘 개선하는가'를 측정하는 벤치마크다. HarnessOpt-Bench에서 최적화 모델은 타겟 에이전트의 하네스를 받고, 제한된 평가 예산 내에서 수정한 뒤 최종 후보를 제출한다. 5개 프론티어 모델·111회 평가 결과, 모델 간 차이가 하네스 간 차이보다 컸고 네이티브 하네스가 항상 유리하지는 않았다.
핵심 요약
- 하네스 최적화를 재현 가능한 평가 타겟으로 만드는 신뢰 실행 환경을 설계했다.
- 5개 프론티어 모델·4개 태스크·111회 평가로 모델·하네스·태스크를 분리했다.
- 최적화 모델 간 차이가 코딩 하네스 간 차이보다 평균적으로 더 크다.
- 광범위한 수정이 더 큰 개선과 연관되고, 실패 추적 상세 분석은 개선과 무관하다.
- 네이티브 하네스가 공유 하네스보다 항상 좋지는 않다 (11승 9패).
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.