RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments

발행일
출처
arXiv
논문 번호
1086
분야
AI / General
arXiv 번호
2609.15364

새 환경에 던져진 에이전트가 사람 도움 없이 스스로 탐색하며 '환경 사용 설명서'를 메모리로 쌓아, 오픈소스 모델을 GPT-6급 이상으로 끌어올리는 훈련 없는 자기개선 프레임워크.

이 논문은 한마디로 에이전트가 낯선 환경에서 스스로 탐색하고 검증하면서 재사용 가능한 기억(메모리)을 쌓는 방법이다. 커리큘럼/실행/검증 에이전트 셋이 돌아가며 '뭘 탐색할지 → 해보고 → 맞는지 확인' 루프를 반복하고, 넓게 훑은 뒤 깊게 파는 전략으로 숨은 규칙과 실패 조건까지 찾아낸다. 만들어진 메모리는 얼려서 그대로 재사용하므로 모델 파라미터를 전혀 수정하지 않는다. 그 결과 Kimi-K3와 GLM-5.3 같은 오픈소스 모델이 OSWorld-v2와 Agent's Last Exam에서 GPT-6, Claude Opus 5 같은 최상위 폐쇄형 모델을 추월했다.

핵심 요약

  • 커리큘럼·실행·검증 에이전트 3역할을 돌리는 재귀 자기개선 루프를 제안해 사람 감독 없이 환경 지식을 쌓았다.
  • '넓게 병렬 탐색 → 중요 방향 깊게 파기' 2단계 전략으로 코너 케이스와 숨은 제약조건까지 메모리에 담았다.
  • 단순 성공 기록이 아니라 행동→조건→결과의 인과관계를 메모리에 저장해 다른 작업에도 재사용했다.
  • 학습 없이(파라미터 수정 없이) 메모리만으로 오픈소스 모델(Kimi-K3, GLM-5.3)을 GPT-6급 성능 이상으로 끌어올렸다.
  • OSWorld-v2에서 부분점수 78.82, Agent's Last Exam 71.60 등 최전선 폐쇄형 모델 추월을 실증했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)