Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
- 발행일
- 출처
- arXiv
- 논문 번호
- 1013
- 분야
- AI / General
- arXiv 번호
- 2608.24876
이 논문은 긴 과제에서 에이전트가 필요한 스킬을 제때 못 쓰는 문제를 '작업 기억+경험 기억' 결합과, 검증을 통과할 때만 기억을 고치는 재귀 루프로 풀었다.
이 논문은 한마디로 긴 과제를 수행하는 AI 에이전트의 기억을 '지금 상황을 추적하는 작업 기억(Working Memory)'과 '쌓아둔 경험에서 스킬을 꺼내주는 경험 기억(Experiential Memory)'으로 나눠 맞물리게 하면 성공률이 크게 오른다는 것이다. 작업 기억이 지금 뭐가 필요한지 추리면 경험 기억이 맞는 스킬을 골라 주고, 실행 결과는 검증해서 작업 기억을 갱신한다. 실패가 나면 어느 기억 부분 탓인지 특정해 그 부분만 고치고, 검증을 통과해야 반영한다. 그 결과 4개 장기 벤치마크·10개 모델의 37개 조합 중 35개가 좋아졌고, 과제가 길수록 효과가 커서 최장 구간에서는 +32.2점까지 올랐다.
핵심 요약
- 검증된 현재 과제 상태를 작업 기억에 유지하고, 그 상태를 기준으로 경험 기억에서 필요한 스킬을 찾게 해 긴 대화 기록의 잡음을 줄였다.
- 실행 흔적으로 실패 위치를 기억 구성 요소까지 좁힌 뒤 해당 부분만 고치고, 검증을 통과한 수정만 반영하는 재귀 개선 고리를 만들었다.
- 네 장기 과제와 열 개 모델의 완료된 37개 조합 중 35개가 향상됐고, 최고 성능 모델도 15~18점가량 올라 최대 성공률 87.9%에 도달했다.
- 과제가 길수록 이득이 커져 가장 긴 구간에서 32.2점 향상됐고, 대표적인 장기 과제 실패 유형은 최대 80% 이상 줄었다.
- 다만 실패 위치 표시는 엄밀한 인과 판정이 아니라 가장 고치기 좋은 부분을 고르는 결정이며, 일부 검사기 구성 요소는 효과가 없던 과제 때문에 충분히 검증되지 않았다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.