Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- 발행일
- 출처
- arXiv
- 논문 번호
- 160
- 분야
- Agents / Infrastructure
- arXiv 번호
- 2604.25850
Agentic Harness Engineering(AHE)은 코딩 에이전트 하네스를 자동으로 진화시키는 폐루프 시스템으로, Terminal-Bench 2의 pass@1 점수를 69.7%에서 77.0%로 향상시킨 것으로 입증되었다.
Agentic Harness Engineering(AHE)은 코딩 에이전트 하네스를 자동으로 진화시키는 폐루프 시스템으로, Terminal-Bench 2의 pass@1 점수를 69.7%에서 77.0%로 향상시킨 것으로 입증되었다. 이 프레임워크는 미학습 과제와 다양한 베이스 모델로의 긍정적 전이 가능성도 보였으며, 동작을 구조화된 구성요소로 인코딩하여 토큰 효율도 개선했다.
핵심 요약
- 코딩 에이전트 하네스(시스템 프롬프트, 도구, 미들웨어)를 수동으로 설계·최적화하는 것은 시간이 많이 들고 LLM의 빠른 발전 속도를 따라잡기 어렵다.
- 기존 자동 최적화 방법은 주로 개별 하네스 구성요소를 다듬는 데 집중하여, 상호작용하는 구성요소 전체를 함께 진화시키지 못한다.
- 이질적인 행동 공간, 긴 에이전트 궤적에서 실행 가능한 신호를 추출하는 어려움, 편집 효과의 복잡한 귀인 문제로 인해 하네스의 공동 진화를 자동화하기는 어렵다.
- AHE는 베이스 LLM은 고정한 채, 편집 가능한 모든 하네스 구성요소를 폐루프 안에서 지속적으로 최적화하는 진화 에이전트를 도입한다.
- NexAU 하네스 기반을 통한 구성요소 관측성 축을 활용하여, 일곱 가지 구성요소 유형을 명시적인 파일 단위 요소로 분리해 국소화된 행동 공간을 만든다.
- 경험 관측성 축은 Agent Debugger를 사용해 원시 에이전트 궤적을 구조화된 실행 가능 증거 코퍼스로 변환하며, 결정 관측성은 Evolve Agent가 증거 기반 편집을 생성해 버전 관리되는 변경 매니페스트에 기록함으로써 구현된다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.