HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

발행일
출처
arXiv
논문 번호
1060
분야
Agents / Infrastructure
arXiv 번호
2609.01437

에이전트가 하네스를 직접 만들고 고치게 한 뒤, 숨긴 과제와 다른 실행 모델에서도 성능이 유지되는지를 검증한 벤치마크다.

이 논문은 모델이 정해진 하네스 안에서 문제를 푸는 능력이 아니라, 실행 루프·도구·문맥·상태·복구·검증을 맡는 하네스 자체를 만들고 개선하는 능력을 평가하는 HarnessDev를 제안한다. 생성 단계에서는 6개 모델이 약한 초기 코드에서 출발해 코드·검색·글쓰기·머신러닝 실험용 하네스를 만들고, 진화 단계에서는 실제 실행 피드백으로 자기 하네스를 반복 수정한다. 총 2,207개 과제 평가에서 생성된 하네스는 글쓰기와 머신러닝 실험에서는 선택된 사람 제작 기준과 비슷하거나 앞섰지만, 코드와 장기 검색·연구에서는 크게 뒤처졌다. 더 중요한 결과는 보이는 평가 점수의 개선이 숨긴 과제로 잘 이어지지 않았다는 점이다. 64번의 버전 전환 중 보이는 점수와 숨긴 점수가 같은 방향으로 움직인 경우는 34번뿐이었고, 모델이 최종 선택한 9개 버전 중 숨긴 과제에서 실제 최적이었던 버전은 2개뿐이었다. HDATF Harness v4에는 기능을 많이 추가하는 것보다 버전 고정, 숨긴 과제 검증, 다른 실행 모델로의 이전성 검사, 실패 시 되돌리기가 중요하다는 직접적인 근거다.

핵심 요약

  • HarnessDev는 하네스를 한 번의 답변이 아니라 여러 과제에 재사용되는 실행 인프라로 정의하고, 생성과 진화를 분리해 능력과 실행 토큰 비용을 함께 평가한다.
  • 6개 생성 모델, 4개 분야, 5개 벤치마크의 2,207개 고유 과제를 사용했으며, 생성된 하네스는 글쓰기·머신러닝 실험에는 강했지만 코드·검색·연구에서는 사람 제작 기준보다 뒤처졌다.
  • 코드 하네스 18개는 모두 실행 루프를 만들었지만 상태·메모리는 가장 약했다. 11개가 State 클래스를 선언했어도 저장 인터페이스와 주기적 체크포인트는 각각 1개뿐이었고, 26,679개 실행 기록에서 체크포인트 이벤트는 한 번도 나타나지 않았다.
  • 9개 진화 과정의 73개 공식 버전과 64번의 버전 전환을 분석한 결과, 보이는 점수와 숨긴 점수가 같은 방향으로 움직인 비율은 53.1%였고 최종 선택 버전이 숨긴 과제의 최적 버전인 경우는 2/9에 그쳤다.
  • 실행 모델을 Gemini로 고정한 진화 실험에서는 Opus 계열만 숨긴 과제 성능이 좋아지고 나머지 3개 계열은 나빠져, 하네스 개선이 특정 모델과 공개 피드백에 과적합될 수 있음을 보여줬다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)