Memory Anchors for Continual Robot Learning

발행일
출처
arXiv
논문 번호
1034
분야
Robotics
arXiv 번호
2608.26545

로봇 연속학습에서 리플레이 버퍼 안의 소수 핵심 데이터(메모리 앵커)가 망각 방지를 좌우한다는 발견과 이를 활용한 알고리즘(ANCHORER).

이 논문은 한마디로 로봇이 새 과제를 배울 때 옛 과제를 잊는 문제가 리플레이 버퍼(옛 데이터를 다시 섞어 학습하는 장치) 안 소수의 핵심 기억에 크게 좌우된다는 걸 보인 연구다. 저자들은 새 과제 관측이 옛 과제 관측과 표현이 겹치면서도 행동은 충돌하는 영역을 찾아, 그 충돌 영역과 가장 비슷한 옛 데이터를 메모리 앵커로 정의했다. 상위 10% 앵커만 빼도 망각이 4.5배 늘고, 반대로 버퍼의 10%를 앵커로 채우면 충돌 과제 망각이 63% 줄었다. 실제 로봇 연속학습에서도 무작위 버퍼 대비 총 성공률 1.7배를 달성했다.

핵심 요약

  • 리플레이 버퍼의 모든 데이터가 똑같이 중요한 게 아니라, 충돌 영역의 소수 데이터가 망각 방지를 좌우함을 발견했다.
  • 정책 잠재공간에서 관측은 겹치는데 행동이 충돌하는 영역을 찾아 메모리 앵커를 뽑는 3단계 절차를 만들었다.
  • 상위 10% 앵커만 제외해도 LIBERO 벤치마크에서 망각이 4.5배 증가했다.
  • 버퍼 10%를 앵커로 채우는 ANCHORER는 충돌 과제 망각을 63% 줄였다.
  • 실제 로봇 두 과제 시퀀스 연속학습에서 무작위 버퍼 대비 총 성공률 1.7배를 냈다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)