Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

발행일
출처
arXiv
논문 번호
644
분야
AI / General
arXiv 번호
2607.13285

에이전트 하네스(시스템 코드)를 행동 단위로 정리해, 어디를 고쳐야 하는지 쉽게 찾게 해주는 도구.

이 논문은 한마디로 AI 에이전트의 하네스(프롬프트 구성·상태 관리·도구 호출을 담당하는 코드)를 수정할 때 '어디를 바꿔야 하는지'를 자동으로 찾아주는 행동 중심 표현이다. Harness Handbook은 정적 코드 분석과 LLM을 결합해 코드를 행동 단위로 재구성한다. 결과는 더 정확한 위치 특정, 더 적은 토큰 사용으로 더 좋은 수정 계획을 생성한다.

핵심 요약

  • 행동 국소화(behavior localization) 문제를 정의했다: 수정 요청이 설명하는 행동이 코드 어디에 구현되어 있는지 찾는 것.
  • Harness Handbook: 코드를 파일/함수가 아닌 '행동' 단위로 재구성하고 각 행동을 소스 코드에 직접 연결한다.
  • Behavior-Guided Progressive Disclosure(BGPD): 고수준 행동 설명에서 관련 구현 디테일로 단계적 탐색을 유도한다.
  • 두 오픈소스 하네스(Codex, Terminus-2)에서 승률 38.3%/45.6%로 베이스라인(28.3%/26.7%)을 능가했다.
  • 특히 여러 파일에 걸친 수정, 드물게 실행되는 코드 경로, 모듈 간 상호작용에서 큰 이득을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)