MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
- 발행일
- 출처
- arXiv
- 논문 번호
- 112
- 분야
- Memory / RL / Agents
- arXiv 번호
- 2601.03192
MemRL은 동결된 대규모 언어 모델 백본을 동적 에피소드 메모리와 분리하여, AI 에이전트가 배포 이후에도 지속적으로 기술을 개선하게 하는 비파라미터 방식을 도입한다.
MemRL은 동결된 대규모 언어 모델 백본을 동적 에피소드 메모리와 분리하여, AI 에이전트가 배포 이후에도 지속적으로 기술을 개선하게 하는 비파라미터 방식을 도입한다. 이 프레임워크는 강력한 베이스라인 대비 누적 성공률에서 평균 3.8%의 상대적 개선을 달성하여, 학습된 지식이 다양한 과제 전반에 걸쳐 우수한 전이성을 가짐을 입증했다.
핵심 요약
- AI 에이전트는 이전에 학습한 지식의 파국적 망각 없이 배포 이후 지속적으로 기술을 습득하는 데 어려움을 겪는다.
- 지속적 적응을 위해 대규모 언어 모델(LLM)을 미세조정하는 것은 연산 비용이 크고 파국적 망각에 매우 취약하다.
- 기존 검색 증강 생성(RAG) 시스템은 수동적이어서, 의미적으로 관련은 있으나 효용이 낮은 '노이즈'를 메모리에서 검색하는 경우가 많아 환경 피드백으로부터의 효과적 학습을 방해한다.
- MemRL은 안정적이고 동결된 LLM 백본을 동적이고 가소적인 외부 에피소드 메모리와 분리하여, 가중치 업데이트나 파국적 망각 없이 지속적 학습을 가능하게 한다.
- 이 시스템은 메모리 검색을 메모리 기반 마르코프 결정 과정(M-MDP)으로 정식화하며, 여기서는 LLM 파라미터가 아니라 검색 정책이 강화학습을 통해 최적화된다.
- 이 시스템은 '의도-경험-효용' 삼중 메모리 구조와, 의미적 회상과 가치 인식 선택을 결합한 2단계 검색 메커니즘을 활용하여 고효용 경험을 능동적으로 걸러내고 활용한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.