EmbodiedRSI: Active Continual Robot Learning Through Hypothesis-Guided Co-Evolution
- 발행일
- 출처
- arXiv
- 논문 번호
- 1179
- 분야
- Robotics
- arXiv 번호
- 2610.10498
로봇이 다음 물리 실험을 스스로 골라 코드·스킬을 공동 진화시키는 자기개선 하네스로, 값비싼 원격조종 데이터 없이 최고 baseline 대비 약 2배 성공률을 냈다.
이 논문은 한마디로 로봇이 어떤 실험을 하면 가장 배울 많한지 스스로 정해서 코드와 스킬을 개선해가는 자기진화 하네스다. 가설 그래프에 코드·스킬 가설을 쌓고, 정보 가치(실험 하나가 불확실성을 얼마나 줄이는지)가 큰 실험을 골라 물리로 수행한다. 결과로 코드-스킬 공동진화를 일으키고, 3단 계층 메모리에 경험을 쌓아 다음 탐험에 쓴다. RoboCasa365에서 77.0%로 최고 baseline(40.1%)을 크게 앞섰고, 실제 로봇에 제로샷으로 옮겨 71.3% 성공률을 냈다.
핵심 요약
- 정보 가치 기반 실험 선택으로 로봇 시행 착오 횟수를 줄이며 탐색 효율을 높였다.
- 코드 가설과 스킬 가설을 별도 평가 후 공동 실행 이득까지 측정하는 공동진화 구조를 만들었다.
- RoboCasa365 전체 77.0%, unseen 조합 71.3%로 최고 baseline 40.1%를 크게 앞질렀다.
- LIBERO-Pro에서 86.8% 성공, 시뮬레이션에서 실제 로봇으로 제로샷 전이 시 71.3%를 달성했다.
- 경험 기록-가설-추출 지식의 3단 계층 메모리가 다음 실험 선택에 재사용되는 구조를 제안했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.