Living-Harness Is an Interactive-Agent Evolver
- 발행일
- 출처
- arXiv
- 논문 번호
- 763
- 분야
- Agents
- arXiv 번호
- 2607.26598
실패 경험을 harness의 메모리와 상태 그래프에 저장해, 같은 실수를 반복하지 않는 자가 진화 에이전트 프레임워크.
이 논문은 한마디로 에이전트가 실패한 뒤 '다음엔 이렇게 하자'는 교훈을 단순히 기억하는 게 아니라, 실행 가능한 수리(repair) 절차로 바꿔서 저장하는 시스템이다. Living-Harness는 에피소드가 끝나면 평가 신호를 바탕으로 무엇이 잘못됐는지 분석하고, 이를 에피소드 메모리와 상태 그래프에 구조화된 수리 정보로 기록한다. 다음 작업에서 이를 검색해 재사용한다. τ²-Bench에서 평균 +10%p, MultiWOZ에서 +9.9%p 향상을 달성했다.
핵심 요약
- 에이전트 실패를 일회성 교훈이 아닌 '실행 가능한 절차적 수리(procedural repair)'로 변환해 영구 저장했다.
- 에피소드 메모리(트리거 조건·실패 패턴·복구 행동)와 상태 그래프(상태 노드·수리 엣지·전이 규칙) 두 축으로 지식을 축적했다.
- Evolution-SOP라는 도메인 수준 가이드로 무엇을 어떻게 수정할지 구조화했다.
- τ²-Bench에서 평균 +10.07p, MultiWOZ-2.4에서 +9.91p 향상을 달성했다.
- GPT-5.2로 진화시킨 harness 상태를 Gemini 3 Pro, GLM-5, Qwen3-max 등 다른 모델에 검색만으로 전달해도 성능이 올랐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.