Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

발행일
출처
arXiv
논문 번호
589
분야
AI / General
arXiv 번호
2607.08716

장기 과제에서 에이전트가 이전 정보를 잊는 '행동 상태 붕괴'를 해결하기 위해, 별도 메모리 에이전트가 능동적으로 개입하는 플러그앤플레이 구조를 제안한 Meta AI의 연구.

장기 과제 수행 중 의사결정에 필요한 정보가 맥락에서 사라지는 '행동 상태 붕괴(behavioral state decay)' 문제를 해결하기 위해, 행동 에이전트와 별도로 동작하는 메모리 에이전트를 제안한다. 메모리 에이전트는 궤적에서 구조화된 메모리를 갱신하고, 필요한 순간에만 타겟팅된 리마인더를 주입하거나 침묵한다. Terminal-Bench 2.0에서 +8.3pp, τ²-Bench에서 +6.8pp 개선을 달성했으며, 오픈웨이트 모델(Qwen3.5-27B) 훈련으로도 +3.5pp 전이를 확인했다.

핵심 요약

  • '행동 상태 붕괴(behavioral state decay)' 개념 정의: 정보가 맥락에 있어도 행동에 영향을 주지 못하는 실패 모드
  • 별도 메모리 에이전트가 구조화된 메모리 뱅크를 유지하며 선택적 개입 여부를 결정하는 2단계 플러그앤플레이 아키텍처
  • Terminal-Bench 2.0에서 Sonnet 4.5 성능 37.6%→45.9% (+8.3pp), τ²-Bench에서 55.0%→61.8% (+6.8pp) 달성
  • 상위 모델(Opus 4.6)에서도 +2.4~2.5pp 개선 효과가 유지되어 강한 모델에서도 유효
  • 능동적 개입이 수동적 메모리 노출, 항상 주입, 어드바이저 모델, Mem0 검색보다 우수함을 폐널레이션으로 입증
  • Qwen3.5-27B를 SFT+GRPO로 훈련한 오픈웨이트 메모리 에이전트도 Terminal-Bench에서 +3.5pp transfer 달성

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)