AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
- 발행일
- 출처
- arXiv
- 논문 번호
- 972
- 분야
- AI / General
- arXiv 번호
- 2608.20318
AI 에이전트가 'AI를 만드는 학습 알고리즘' 자체를 개선할 수 있는지를 처음으로 분리 측정하는, 재귀적 자기개선(RSI) 전용 벤치마크다.
이 논문은 한마디로 'AI가 AI를 가르치는 훈련 알고리즘 자체를 개선할 수 있는가'만을 떼어내 측정한 벤치마크 논문이다. 연구용 코드 저장소 10개(SFT, 강화학습, 증류, 보상모델링 등 알고리즘 계열 10종)를 얼려 두고, 에이전트에게 GPU 1장과 4시간을 줘 학습 코드를 고치게 한 뒤, 그 패치를 처음부터 최대 12시간 다시 돌려 숨겨둔 평가기로 점수를 매긴다. 결과는 6개 시스템 29개 설정 평균 0.166, 최고 시스템도 0.250에 그쳤다(기존 알고리즘=0.1, 최적=1.0 척도). 바꾼 제출 263건 중 141건은 학습 방식을 건드리지도 않았고, 건드린 122건은 평균 0.226으로 나머지(0.126)를 크게 앞섰다. 추론 노력을 높이면 '학습법을 바꿔보는 비율'이 8%에서 64%로 늘었고 평균 점수도 0.094에서 0.196으로 올라갔다.
핵심 요약
- 훈련 알고리즘 계열 10가지를 담은 연구 저장소 10개를 얼려두고, 에이전트가 4시간 동안 학습 코드를 고치면 처음부터 최대 12시간 재학습해 숨겨진 평가기로 채점하는 벤치마크를 만들었다.
- 6개 시스템 29개 설정의 평균 점수는 0.166, 최고 성능도 0.250으로 원래 알고리즘(0.1)과 최적(1.0) 사이 거리의 다섯 분의 일도 못 메웠다.
- 변경을 가한 263건 중 141건은 학습 절차를 전혀 건드리지 않았고, 건드린 122건은 평균 0.226으로 나머지(0.126)를 크게 앞질렀다.
- 추론 노력을 높이면 알고리즘 계층에 도전하는 비율이 8%에서 64%로, 평균 점수는 0.094에서 0.196으로 올라갔다.
- 과제 모음과 평가기, 모든 채점된 제출물을 공개해 시스템이 변해도 같은 잣대로 다시 측정할 수 있게 했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.