Can Agent Memory Systems Track Evolving State?
- 발행일
- 출처
- arXiv
- 논문 번호
- 980
- 분야
- AI / General
- arXiv 번호
- 2608.19652
오래된 사실을 '현재 상태'로 잘못 쓰는 에이전트 기억망의 '상태 추적' 실패를 벤치마크로 분리해내고, 값 변경을 추적하는 기억 설계로 크게 개선한 논문이다.
이 논문은 한마디로 에이전트 기억 시스템이 '바뀐 사실'을 제대로 따라가는 능력(상태 추적)을 따로 측정한 벤치마크와 개선 방법을 제안한 연구다. 저자들은 필요한 사실을 잘 찾아와도 옛값에 근거해 답하는 '상태 드리프트' 실패를 정의하고, 234개 다중 세션 시나리오로 StateMemBench를 만들었다. 대체 관계(나중 값이 앞 값을 대체함)와 의존 관계를 명시적으로 추적하는 StateMem 기억법이 최강 동일백본 대비 최대 1.8배(0.205에서 0.363) 정확도를 올렸다. 기존 기억 시스템에 씌우는 래퍼 형태로는 어떤 백엔드든 +32~+67점을 끌어올렸다.
핵심 요약
- '상태 드리프트'를 정의했다. 필요한 사실이 검색 결과에 있어도 에이전트가 옛값이나 폐기된 값으로 답하는 실패로, 완벽한 검색 조건에서도 남는다는 점을 보여 '잘 찾기'와 별개의 문제임을 증명했다.
- 234개 다중 세션 시나리오의 StateMemBench를 만들고, 닫힌 보기 채점으로 '현재 상태/옛 상태/기타 실패'를 구분해 상태 추적 실패만 깨끗하게 분리했다.
- StateMem은 값 대체와 의존 관계(파생 값 재계산)를 명시 추적하는데, DeepSeek-V4-Flash에서 최강 동일백본 대비 1.8배(0.205에서 0.363), Qwen-3.5-9B에서 기존 최강 기억 시스템 대비 1.6배(0.149에서 0.233) 현재 상태 정확도를 올렸다.
- 기존 기억 시스템에 씌우는 한 번 호출 래퍼로도 6개 백엔드 모두 +32~+67점 상승했고, 길이·비용을 맞춘 대조군 비교로 이 중 +15~+32점은 '상태 구조' 자체의 효과임을 분리해냈다.
- 기존 벤치마크(LongMemEval 등)의 실패 분포에서도 상태 드리프트가 앞자리를 차지하는 것을 판정자 라벨링으로 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.