Learning from Research: Toward Lifelong Agent Harness Evolution
- 발행일
- 출처
- arXiv
- 논문 번호
- 1143
- 분야
- AI / Agents
- arXiv 번호
- 2609.40169
이 논문은 AI 논문을 읽고 에이전트 하네스(도구·메모리·실행 로직을 정리하는 소프트웨어)를 스스로 진화시키는 프레임워크를 제안했다.
이 논문은 한마디로 에이전트가 최신 연구 논문에서 배워서 자기 실행 소프트웨어(하네스)를 평생 계속 개선하게 만드는 프레임워크 ScholarEvolve를 제안한 연구다. 기존 방식은 실행 기록의 실패만 보고 고치라 시켜서 소극적이고 탐색 범위가 좁았다. 저자들은 하네스 개선 방향을 기능 모듈로 나누고, 토픽 모델링(문서에서 주제를 뽑는 기법)으로 논문 속 개선 전략을 찾아 조합해 적용한다. 결과적으로 Qwen3.5-27B의 AppWorld 과제 완수율을 49.6%에서 63.6%로, GPT-5.4-mini의 통신 벤치마크를 72.7%에서 81.9%로 끌어올렸다.
핵심 요약
- 모델 가중치는 그대로 두고, 에이전트를 감싼 소프트웨어(하네스)를 논문에서 배워 스스로 진화시키는 접근이다.
- 실행 기록 기반 기존 방식은 소극적이라는 문제의식에서, 연구 문헌을 읽고 개선 전략을 먼저 뽑아내는 능동적 진화로 바꿨다.
- 토픽 모델링으로 논문에서 개선 전략을 찾고, 그 조합을 실험해 골라내는 파이프라인을 만들었다.
- AppWorld에서 과제 완수율 49.6%→63.6%, Tau2-Bench Telecom에서 72.7%→81.9%로 향상됐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.