Living-Harness Is an Interactive-Agent Evolver

발행일
출처
arXiv
논문 번호
763
분야
Agents
arXiv 번호
2607.26598

실패 경험을 harness의 메모리와 상태 그래프에 저장해, 같은 실수를 반복하지 않는 자가 진화 에이전트 프레임워크.

이 논문은 한마디로 에이전트가 실패한 뒤 '다음엔 이렇게 하자'는 교훈을 단순히 기억하는 게 아니라, 실행 가능한 수리(repair) 절차로 바꿔서 저장하는 시스템이다. Living-Harness는 에피소드가 끝나면 평가 신호를 바탕으로 무엇이 잘못됐는지 분석하고, 이를 에피소드 메모리와 상태 그래프에 구조화된 수리 정보로 기록한다. 다음 작업에서 이를 검색해 재사용한다. τ²-Bench에서 평균 +10%p, MultiWOZ에서 +9.9%p 향상을 달성했다.

핵심 요약

  • 에이전트 실패를 일회성 교훈이 아닌 '실행 가능한 절차적 수리(procedural repair)'로 변환해 영구 저장했다.
  • 에피소드 메모리(트리거 조건·실패 패턴·복구 행동)와 상태 그래프(상태 노드·수리 엣지·전이 규칙) 두 축으로 지식을 축적했다.
  • Evolution-SOP라는 도메인 수준 가이드로 무엇을 어떻게 수정할지 구조화했다.
  • τ²-Bench에서 평균 +10.07p, MultiWOZ-2.4에서 +9.91p 향상을 달성했다.
  • GPT-5.2로 진화시킨 harness 상태를 Gemini 3 Pro, GLM-5, Qwen3-max 등 다른 모델에 검색만으로 전달해도 성능이 올랐다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)