EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

발행일
출처
arXiv
논문 번호
410
분야
LLMs / NLP
arXiv 번호
2606.13681

환경이 계속 변하는 동적 설정에서 LLM 에이전트를 평가하는 EvoArena 벤치마크와 patch 기반 메모리 EvoMem 제안. 현존 최강 에이전트들도 평균 39.6%에 그쳤으며, EvoMem은 표준 벤치마크에서도 4.8-6.1% 향상을 보였다.

EvoArena는 터미널·소프트웨어·소셜 도메인에서 환경이 점진적으로 업데이트되는 시나리오로 에이전트를 평가한다. 기존 벤치마크들이 정적 환경을 가정하는 것과 달리, 동일한 환경이 버전별로 변하는 실제 배포 환경을 모델링한다. EvoMem은 git-like patch 기반 메모리로, 메모리 변경을 append-only 이력으로 기록해 에이전트가 환경 변화를 추론할 수 있게 한다. GPT-5.5조차 step accuracy 50.8%에 그쳤으며, EvoMem은 EvoArena 평균 +1.5%, chain accuracy +3.7%, GAIA +6.1%, LoCoMo +4.8% 향상을 가져왔다.

핵심 요약

  • EvoArena: 터미널·소프트웨어·소셜 환경이 버전별로 진화하는 동적 에이전트 벤치마크
  • 현재 최강 에이전트들도 평균 39.6%에 그쳐, 동적 환경 적응이 큰 도전 과제임을 입증
  • EvoMem: 메모리 변경을 patch 이력(사전·사후 상태, 변경 사유, 증거)으로 저장하는 git-like 메모리
  • EvoArena +1.5%, chain-level +3.7%, GAIA +6.1%, LoCoMo +4.8% 일관된 성능 향상
  • 소프트웨어 회귀 분석: PASS_TO_PASS 실패율 평균 9.09%→6.32% 감소
  • 시간 궤적·다중 패턴 종합 질문에서 가장 큰 개선(+5.2%), evidence 보존 효과 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)