Meta-Harness: End-to-End Optimization of Model Harnesses
- 발행일
- 출처
- arXiv
- 논문 번호
- 131
- 분야
- Agents / Benchmarks
- arXiv 번호
- 2603.28052
코딩 에이전트가 이전 코드, 점수, 원시 실행 트레이스에 대한 완전한 파일시스템 접근으로 실행 가능한 하니스 코드를 탐색하게 함으로써 LLM 하니스 엔지니어링을 자동화한다.
Meta-Harness는 LLM을 둘러싼, 흔히 수작업으로 이루어지는 계층, 즉 무엇을 저장하고 검색하며 컨텍스트에 배치할지 결정하는 하니스 코드를 표적으로 한다. 프롬프트 문자열을 최적화하거나 압축된 피드백에 의존하는 대신, 에이전트형 제안자가 일반적인 파일시스템 도구를 통해 이전의 모든 소스 코드, 점수, 원시 실행 트레이스를 검사하고, 새로운 Python 하니스를 제안하며, 추후 디버깅을 위해 전체 롤아웃을 기록하는 외부 루프를 실행한다. 온라인 텍스트 분류, 검색 증강 IMO 스타일 수학, TerminalBench-2 코딩 전반에서 이러한 비압축 이력 접근법은 Label-Primed Query 검색, 재순위화를 동반한 주제별 수학 검색, 터미널 환경 부트스트래핑과 같은 구체적 알고리즘 변경을 만들어냈다. 보고된 성과로는 ACE 대비 컨텍스트 토큰을 4배 적게 쓰면서 정확도가 7.7 향상되고, 다섯 개의 홀드아웃 수학 모델 평균 4.7점 향상, 그리고 Claude 기반 에이전트의 리더보드 수준 TerminalBench-2 통과율이 포함된다.
핵심 요약
- 핵심 아이디어는 하니스를 프롬프트 템플릿이 아니라 실행 가능한 상태 보유 코드로 취급하고, 검색과 메모리, 프롬프트 구성, 환경 처리 로직을 종단 간으로 탐색하는 것이다.
- 최적화 루프에서는 코딩 에이전트 제안자가 이전 코드, 점수, 프롬프트, 모델 출력, 도구 호출, 트레이스로 구성된 비압축 파일시스템을 탐색한 뒤 평가를 위해 새로운 하니스 후보를 제출한다.
- 실증 결과로, 온라인 분류 정확도가 ACE의 40.9%에 비해 48.6%이면서 컨텍스트 토큰은 4배 적게 사용했고, 다섯 개 홀드아웃 모델 전반의 200개 IMO 수준 수학 문제에서 평균 4.7점 향상되었으며, alphaXiv 리포트에서 TerminalBench-2 기준 Claude Haiku 4.5는 37.6%, Claude Opus 4.6은 76.4%에 도달했다.
- 의의는 원시 트레이스가 제안자로 하여금 장기 시야의 신용 할당 실패를 디버깅하게 해준다는 점이다. 예컨대 롤아웃 초반의 메모리 누락이 이후 답변 실패를 야기하는 경우처럼, 점수만 보거나 요약만 보는 최적화기는 놓치는 부분이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.