Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 213
- 분야
- Machine Learning
- arXiv 번호
- 2605.21768
Memory-R2는 다중 세션 환경에서 장기 지평선의 메모리 증강 LLM 에이전트에 대한 신용 할당을 강화하고 메모리 형성과 진화를 공동으로 최적화하는 훈련 프레임워크를 도입한다.
여러 세션에 걸쳐 기억을 쓰고 지우는 에이전트는 각 실행의 중간 기억 상태가 달라져 단순한 궤적 비교가 불공정해질 수 있다. 이 문제는 GRPO 같은 그룹 상대 강화학습에서 장기 보상이 개별 기억 연산에 잘못 배분되는 원인이 된다. Memory-R2의 LoGo-GRPO는 전체 궤적 보상을 쓰는 전역 목표와 같은 중간 기억 상태에서 다시 실행하는 지역 비교를 결합한다. 사실 추출기와 기억 관리자는 하나의 언어 모델을 역할별 프롬프트로 함께 학습하며, 훈련 세션 길이는 8개에서 16개와 32개로 점차 늘린다. 이 설계는 장기 성과를 유지하면서 기억의 생성과 갱신에 더 공정하고 세밀한 학습 신호를 주려는 방법이다.
핵심 요약
- 데이터 효율성: 놀랍게도 이러한 성능 향상은 단 두 개의 전체 대화 궤적만으로 훈련하여 달성되었으며, 이는 RL 패러다임의 효과성을 입증한다.
- 분포 외(OOD) 벤치마크: LongMemEval 및 MSC-Self-Instruct에서 높은 성능을 보인다.
- 다양한 모델 규모: 3B 모델에서 관찰된 훈련 개선이 7B 모델로도 전이되었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.