Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
- 발행일
- 출처
- arXiv
- 논문 번호
- 815
- 분야
- AI / General
- arXiv 번호
- 2608.02276
이 논문은 에이전트 실패 궤적에서 런타임 하네스를 자동 수정하는 9B 엔지니어를 강화학습으로 학습시켜 평균 9.3%p 성능을 올렸다.
이 논문은 한마디로 에이전트가 실패한 기록을 보고 실행 환경(하네스)의 코드를 스스로 고치는 방법을 제안했다. 모델 가중치를 바꾸는 게 아니라, 에이전트를 둘러싼 런타임(컨텍스트, 도구, 검증, 복구 로직)의 실행 가능한 패치를 생성한다. 9B 하네스 엔지니어가 GRPO로 학습되어, WebShop/ALFWorld/DBBench에서 바닐라 에이전트 대비 +9.3%p 향상을 달성했다.
핵심 요약
- 에이전트 실패 궤적에서 런타임 하네스의 실행 가능한 패치를 자동 생성하는 최초의 학습 기반 방법을 제안했다.
- 9B 하네스 엔지니어가 타깃 에이전트 가중치를 얼려둔 채 GRPO로만 학습되어 안정적인 파이프라인을 구성했다.
- WebShop, ALFWorld, DBBench 3개 벤치마크 평균 +9.3%p 성공률 향상을 달성했다.
- 타깃 에이전트 파인튜닝 후에도 +5.0%p 추가 향상으로, 하네스 엔지니어와 에이전트의 공동 진화 가능성을 보였다.
- 20개 다른 타깃 설정으로 전이 실험에서도 평균 +7.06%p를 기록해 일반화 성능을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.