AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

발행일
출처
arXiv
논문 번호
1005
분야
AI / General
arXiv 번호
2608.23041

이 논문은 에이전트 실행틀(하네스)을 사람이 손으로 다듬지 않고, 실패 기록을 분석해 코드처럼 자동 패치하는 프레임워크를 만들어 세 벤치마크에서 9~10%p씩 성능을 올렸다.

이 논문은 한마디로 '에이전트 하네스 자동 튜닝기'다. AutoSaddler는 실패한 실행 기록을 깊게 디버깅하고, 하네스(프롬프트·도구·제어 로직)를 코드로 취급해 구조화된 패치를 만들고, 검증 세트에서 일반화되는 것만 골라 반영한다. GAIA2·SWE-Bench Pro·Terminal-Bench 2.0에서 기본 하네스 대비 각각 9.0/9.6/10.0%p 향상을 얻었다. GAIA2에서는 72.3%를 약 1,000회 실행으로 달성해 2,800회를 쓴 경쟁 기법들보다 효율적이었다.

핵심 요약

  • 하네스 최적화를 오프라인 학습 문제로 정식화하고, 실패 신호를 받아 반복적으로 패치한다.
  • 얕은 반성이 아니라 깊은 디버깅, 제멋대로 수정이 아니라 구조화된 패치, 일반화 검증이 효과의 핵심이었다.
  • GAIA2에서 72.3%를 약 1,000회 과제 실행으로 달성, 약 2,800회를 쓴 경쟁 기법(64.6%)을 능가했다.
  • 세 벤치마크 모두 기본 하네스 대비 +9.0~10.0%p, 최강 자동 기준선 대비 +4.4~7.4%p 올랐다.
  • 정답이 달린 학습용 과제와 성공 실패 신호가 있어야 작동해 실제 현장에 바로 쓰기 어렵고, 적용 범위도 상태가 이어지지 않는 독립 과제로 한정된다는 한계를 저자들이 밝혔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)