RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement
- 발행일
- 출처
- arXiv
- 논문 번호
- 746
- 분야
- Software Engineering
- arXiv 번호
- 2607.25886
이 논문은 LLM 에이전트가 '데이터 중심 연구자' 역할을 얼마나 잘하는지 측정하는 벤치마크(RSIBench-Data)를 만들고, 4개 최고 수준 에이전트를 테스트한 연구다.
이 논문은 한마디로 AI 에이전트가 스스로 모델 약점을 진단하고 훈련 데이터 전략을 개선할 수 있는지 평가하는 벤치마크를 제안했다. 핵심 발견은 에이전트가 58% 상황에서 피드백을 통해 성능을 개선하지만, 78%는 피드백을 받고도 오히려 성능이 떨어진다는 것이다. 즉 '발견 능력'은 있지만 '안정적 개선'은 아직 못 한다는 뜻이다. 강한 에이전트의 공통 패턴은 정확한 가설, 검증 기반 지도, 행동 정렬 데이터, 강한 체크포인트 보존이었다.
핵심 요약
- 훈련/평가/서빙 인프라를 모두 고정하고 순수하게 '데이터 연구 능력'만 분리해서 측정한 최초의 벤치마크다.
- 4개 최고 수준 에이전트(Codex, Claude Code 등) 중 어느 것도 일관되게 우세하지 못했다 — 비-SWE는 Codex가, SWE 3종은 각기 다른 에이전트가 이겼다.
- 피드백을 받은 후 최고점을 찍고도 78%는 마지막 시도에서 점수가 하락했다 (발견-신뢰성 갭).
- 추리 노력(max effort)을 높이면 더 강한 후보를 더 일찍 찾지만, 탐색 횟수는 줄어드는 깊이-너비 트레이드오프를 발견했다.
- 같은 모델 계열(kimi-k2.6)로 자기 개선(RSI) 실험을 했지만, 8%→21%로 향상되에도 불구하고 원본 33%에는 미치지 못했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.