Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents

발행일
출처
arXiv
논문 번호
108
분야
Memory / Agents
arXiv 번호
2601.01885

Agentic Memory(AgeMem)는 대규모 언어 모델 에이전트가 학습 가능한 도구 기반 행동을 통해 장기 및 단기 메모리를 모두 자율적으로 관리하는 통합 프레임워크를 도입한다.

Agentic Memory(AgeMem)는 대규모 언어 모델 에이전트가 학습 가능한 도구 기반 행동을 통해 장기 및 단기 메모리를 모두 자율적으로 관리하는 통합 프레임워크를 도입한다. 3단계 점진적 강화학습 전략으로 최적화된 이 시스템은 장기 과제 벤치마크에서 일관되게 과제 성능을 향상시키고, 저장된 메모리의 품질을 높이며, 기존 메모리 증강 베이스라인 대비 프롬프트 토큰 사용량을 줄인다.

핵심 요약

  • LLM 에이전트는 유한한 컨텍스트 윈도우로 인해 장기 추론에 어려움을 겪으며, 효과적인 메모리 관리가 필요하다.
  • 전통적인 메모리 시스템은 장기 및 단기 메모리를 독립적인 구성요소로 취급하여, 조율이 최적 이하인 단편적이고 휴리스틱 기반의 솔루션을 초래한다.
  • 긴 궤적에 걸쳐 보상 신호가 희소하고 불연속적이기 때문에 표준 강화학습으로 메모리 연산을 최적화하기는 어렵다.
  • AgeMem은 LTM(ADD, UPDATE, DELETE) 및 STM(RETRIEVE, SUMMARY, FILTER) 연산을 에이전트 정책 안의 명시적인 도구 기반 행동으로 정식화하여, 자율적이고 학습 가능한 메모리 제어를 가능하게 한다.
  • 포괄적인 메모리 역량을 학습하기 위해 3단계 점진적 강화학습 전략(LTM 구축, 방해 요소를 동반한 STM 제어, 통합 추론)을 사용한다.
  • 단계별 Group Relative Policy Optimization(GRPO)은 종단 보상을 궤적 단계 전반에 균일하게 전파함으로써 메모리 결정에 대한 일관된 학습 신호를 보장하여, 희소 보상 문제를 해결한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)