Automated Discovery Has No Universally Superior Harness

발행일
출처
arXiv
논문 번호
688
분야
LLMs / NLP
arXiv 번호
2607.18235

LLM 기반 자율 발견 시스템에서 '어떤 검색 하네스(전략)'도 항상 최고는 아니라는 것을 310만 회 실험으로 증명한 연구.

이 논문은 한마디로 LLM으로 코드를 진화시키는 자율 발견 시스템(OpenEvolve, TTT-Discover 등)에서 '어떤 검색 전략(harness)도 모든 문제에 universally 최고는 아니다'를 대규모 실험으로 보인 연구다. 30가지 하네스를 12개 모델-문제 쌍에서 310만 회 이상 롤아웃하여 비교했다. 복잡한 OpenEvolve 방식이 오히려 더 단순한 베이스라인보다 못한 경우가 많았다. 대신 초기 진행 성적이 최종 성능을 잘 예측하므로, 여러 하네스를 시작하고 약한 것을 일찍 잘라내어 강한 것에 예산을 몰아주는 적응적 할당이 가장 효과적이었다.

핵심 요약

  • OpenEvolve와 TTT-Discover의 하네스를 구성 요소별로 분해해서 30가지 조합을 만들어 비교했다.
  • 310만 회 이상 LLM 롤아웃으로 통계적으로 유의미한 비교를 수행했다.
  • 어떤 고정 하네스도 모든 모델-문제 쌍에서 일관되게 최고가 아니라는 '일반화 문제'를 발견했다.
  • 초기 진행 성적이 최종 성능을 강하게 예측한다는 점을 활용해 적응적 예산 할당 전략을 제안했다.
  • 모든 실행 기록과 베이스라인 분포를 재사용 가능한 통계 인프라로 공개했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)