Can Agent Memory Systems Track Evolving State?

발행일
출처
arXiv
논문 번호
980
분야
AI / General
arXiv 번호
2608.19652

오래된 사실을 '현재 상태'로 잘못 쓰는 에이전트 기억망의 '상태 추적' 실패를 벤치마크로 분리해내고, 값 변경을 추적하는 기억 설계로 크게 개선한 논문이다.

이 논문은 한마디로 에이전트 기억 시스템이 '바뀐 사실'을 제대로 따라가는 능력(상태 추적)을 따로 측정한 벤치마크와 개선 방법을 제안한 연구다. 저자들은 필요한 사실을 잘 찾아와도 옛값에 근거해 답하는 '상태 드리프트' 실패를 정의하고, 234개 다중 세션 시나리오로 StateMemBench를 만들었다. 대체 관계(나중 값이 앞 값을 대체함)와 의존 관계를 명시적으로 추적하는 StateMem 기억법이 최강 동일백본 대비 최대 1.8배(0.205에서 0.363) 정확도를 올렸다. 기존 기억 시스템에 씌우는 래퍼 형태로는 어떤 백엔드든 +32~+67점을 끌어올렸다.

핵심 요약

  • '상태 드리프트'를 정의했다. 필요한 사실이 검색 결과에 있어도 에이전트가 옛값이나 폐기된 값으로 답하는 실패로, 완벽한 검색 조건에서도 남는다는 점을 보여 '잘 찾기'와 별개의 문제임을 증명했다.
  • 234개 다중 세션 시나리오의 StateMemBench를 만들고, 닫힌 보기 채점으로 '현재 상태/옛 상태/기타 실패'를 구분해 상태 추적 실패만 깨끗하게 분리했다.
  • StateMem은 값 대체와 의존 관계(파생 값 재계산)를 명시 추적하는데, DeepSeek-V4-Flash에서 최강 동일백본 대비 1.8배(0.205에서 0.363), Qwen-3.5-9B에서 기존 최강 기억 시스템 대비 1.6배(0.149에서 0.233) 현재 상태 정확도를 올렸다.
  • 기존 기억 시스템에 씌우는 한 번 호출 래퍼로도 6개 백엔드 모두 +32~+67점 상승했고, 길이·비용을 맞춘 대조군 비교로 이 중 +15~+32점은 '상태 구조' 자체의 효과임을 분리해냈다.
  • 기존 벤치마크(LongMemEval 등)의 실패 분포에서도 상태 드리프트가 앞자리를 차지하는 것을 판정자 라벨링으로 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)