RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

발행일
출처
arXiv
논문 번호
1105
분야
Machine Learning
arXiv 번호
2609.24972

에이전트의 하네스(프롬프트·도구·메모리 등 프로그램 뼈대)를 자동으로 개선하다 보면 가던 벤치마크에만 맞춰지는 문제를, '정규화' 개념을 점검·선택 단계에 넣어 해결한 논문이다.

이 논문은 한마디로 에이전트 하네스 자동 개선의 '벤치마크 과적합'을 막는 프레임워크다. 하네스란 모델 가중치를 뺀 나머지, 즉 프롬프트와 도구, 메모리 관리 같은 에이전트의 뼈대를 뜻한다. 기존 방식은 반복 개선을 거듭할수록 학습에 쓴 과제에만 최적화되고 처음 보는 과제에선 성능이 늘지 않았다. RRSI는 제안 단계에선 한 번에 바꿀 수 있는 수정량을 점점 줄이고, 선택 단계에선 벤치마크 특화 로직을 걸러내고 쓸모없어진 수정을 잘라낸다. 그랬더니 8개 벤치마크에서 처음 보는 과제까지 최대 4.7점이 오르고, 토큰 사용량은 30% 줄었다.

핵심 요약

  • 에이전트 하네스를 자동 개선하면 학습에 쓴 벤치마크 점수만 오르고 새 벤치마크에선 성과가 사라지는 '과적합'이 생긴다는 걸 문제로 정식화했다.
  • 제안 단계를 정규화했다. 시간이 갈수록 한 번에 묶을 수 있는 수정 수를 줄이고(점점 작은 수정만 허용), 진행이 막히면 안 쓰던 하네스 부분을 탐색하게 유도한다.
  • 선택 단계를 정규화했다. 벤치마크 특화 로직을 거르는 비평가(critic)와 너무 사소하거나 비싸거나 쓸모없어진 수정을 잘라내는 가지치기(pruner)를 붙였다.
  • 코딩·업무 작업·엔지니어링 설계 등 8개 벤치마크에서 처음 보는 벤치마크 점수가 최대 4.7점 올랐고, 기존 4개 자동 진화 방법의 평균보다 최대 22.9% 앞섰다.
  • 정규화 덕에 최종 하네스가 토큰을 30% 덜 쓴다. 가장 비싼 기존 방법(AHE)보다 토큰 58% 적게 쓰면서 점수는 더 높았다.
  • Gemini와 Claude 두 모델에서, 그리고 진화에 안 쓴 더 작은 모델에서도 개선이 유지됐다. 바꿔 먹은 하네스가 아니라 재사용 가능한 원리를 배운 것이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)