RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
- 발행일
- 출처
- arXiv
- 논문 번호
- 1105
- 분야
- Machine Learning
- arXiv 번호
- 2609.24972
에이전트의 하네스(프롬프트·도구·메모리 등 프로그램 뼈대)를 자동으로 개선하다 보면 가던 벤치마크에만 맞춰지는 문제를, '정규화' 개념을 점검·선택 단계에 넣어 해결한 논문이다.
이 논문은 한마디로 에이전트 하네스 자동 개선의 '벤치마크 과적합'을 막는 프레임워크다. 하네스란 모델 가중치를 뺀 나머지, 즉 프롬프트와 도구, 메모리 관리 같은 에이전트의 뼈대를 뜻한다. 기존 방식은 반복 개선을 거듭할수록 학습에 쓴 과제에만 최적화되고 처음 보는 과제에선 성능이 늘지 않았다. RRSI는 제안 단계에선 한 번에 바꿀 수 있는 수정량을 점점 줄이고, 선택 단계에선 벤치마크 특화 로직을 걸러내고 쓸모없어진 수정을 잘라낸다. 그랬더니 8개 벤치마크에서 처음 보는 과제까지 최대 4.7점이 오르고, 토큰 사용량은 30% 줄었다.
핵심 요약
- 에이전트 하네스를 자동 개선하면 학습에 쓴 벤치마크 점수만 오르고 새 벤치마크에선 성과가 사라지는 '과적합'이 생긴다는 걸 문제로 정식화했다.
- 제안 단계를 정규화했다. 시간이 갈수록 한 번에 묶을 수 있는 수정 수를 줄이고(점점 작은 수정만 허용), 진행이 막히면 안 쓰던 하네스 부분을 탐색하게 유도한다.
- 선택 단계를 정규화했다. 벤치마크 특화 로직을 거르는 비평가(critic)와 너무 사소하거나 비싸거나 쓸모없어진 수정을 잘라내는 가지치기(pruner)를 붙였다.
- 코딩·업무 작업·엔지니어링 설계 등 8개 벤치마크에서 처음 보는 벤치마크 점수가 최대 4.7점 올랐고, 기존 4개 자동 진화 방법의 평균보다 최대 22.9% 앞섰다.
- 정규화 덕에 최종 하네스가 토큰을 30% 덜 쓴다. 가장 비싼 기존 방법(AHE)보다 토큰 58% 적게 쓰면서 점수는 더 높았다.
- Gemini와 Claude 두 모델에서, 그리고 진화에 안 쓴 더 작은 모델에서도 개선이 유지됐다. 바꿔 먹은 하네스가 아니라 재사용 가능한 원리를 배운 것이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.