AREX: Towards a Recursively Self-Improving Agent for Deep Research
- 발행일
- 출처
- arXiv
- 논문 번호
- 700
- 분야
- AI / General
- arXiv 번호
- 2607.21461
심층 연구 에이전트가 답을 찾은 뒤 스스로 검증하고, 틀린 부분을 찾아 다시 조사하는 '재귀적 자기 개선' 구조를 제안한 논문이다.
이 논문은 한마디로 AI 연구 에이전트가 한 번 답을 내고 끝내는 게 아니라, 답을 제약 조건별로 검증하고 미흡한 부분을 집중적으로 다시 조사하는 재귀적 자기 개선(RSI) 구조를 제안했다. AREX는 내부 연구 루프(증거 수집 및 임시 답안 작성)와 외부 개선 루프(답안 감사 및 후속 연구 지시)를 번갈아 실행한다. 긴 대화 내용을 압축해서 핵심 정보만 유지하는 자체 컨텍스트 업데이트 도구도 학습했다. 4B 및 122B-A10B MoE 모델로 BrowseComp 82.5점, HLE 52.4점 등 비슷한 크기 경쟁 모델들을 크게 앞섰다.
핵심 요약
- 발견-검증 비대칭성(답을 찾기는 어렵지만 검증은 쉬운 특성)을 활용해 검증을 다음 연구 라운드의 출발점으로 삼았다.
- 자체 컨텍스트 압축 도구로 긴 대화 내용을 핵심만 남겨서 긴 호라이즌 연구가 가능하다.
- 4B 모델로 BrowseComp 82.5점, HLE 52.4점으로 비슷한 규모 경쟁 모델 대폭 상회한다.
- 에이전트 미드-트레이닝과 장호라이즌 강화학습으로 검색·도구 사용·검증을 단계적으로 가르쳤다.
- 핵심 증거 획득 시점에 가중치를 부여해 희소 보상의 신용 할당 문제를 완화했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.