Memory Anchors for Continual Robot Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 1034
- 분야
- Robotics
- arXiv 번호
- 2608.26545
로봇 연속학습에서 리플레이 버퍼 안의 소수 핵심 데이터(메모리 앵커)가 망각 방지를 좌우한다는 발견과 이를 활용한 알고리즘(ANCHORER).
이 논문은 한마디로 로봇이 새 과제를 배울 때 옛 과제를 잊는 문제가 리플레이 버퍼(옛 데이터를 다시 섞어 학습하는 장치) 안 소수의 핵심 기억에 크게 좌우된다는 걸 보인 연구다. 저자들은 새 과제 관측이 옛 과제 관측과 표현이 겹치면서도 행동은 충돌하는 영역을 찾아, 그 충돌 영역과 가장 비슷한 옛 데이터를 메모리 앵커로 정의했다. 상위 10% 앵커만 빼도 망각이 4.5배 늘고, 반대로 버퍼의 10%를 앵커로 채우면 충돌 과제 망각이 63% 줄었다. 실제 로봇 연속학습에서도 무작위 버퍼 대비 총 성공률 1.7배를 달성했다.
핵심 요약
- 리플레이 버퍼의 모든 데이터가 똑같이 중요한 게 아니라, 충돌 영역의 소수 데이터가 망각 방지를 좌우함을 발견했다.
- 정책 잠재공간에서 관측은 겹치는데 행동이 충돌하는 영역을 찾아 메모리 앵커를 뽑는 3단계 절차를 만들었다.
- 상위 10% 앵커만 제외해도 LIBERO 벤치마크에서 망각이 4.5배 증가했다.
- 버퍼 10%를 앵커로 채우는 ANCHORER는 충돌 과제 망각을 63% 줄였다.
- 실제 로봇 두 과제 시퀀스 연속학습에서 무작위 버퍼 대비 총 성공률 1.7배를 냈다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.