Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 1151
- 분야
- Robotics
- arXiv 번호
- 2610.02204
이 논문은 로봇이 시뮬레이터에서 스스로 연습하며 재사용 가능한 스킬을 다듬어 실기 로봇까지 무보정으로 옮기는 프레임워크를 제안했다.
이 논문은 한마디로 로봇이 사람 보상 설계 없이 스스로 연습해서 실력을 올리게 만든 연구다. RPG는 오프라인 데이터에서 다룰 수 있는 동작을 찾아 시뮬레이터에 연습 과제를 만들고, 실행 실패를 진단해 스킬 라이브러리와 시스템 프롬프트를 고쳐나간다. 모델 가중치는 전혀 건드리지 않는다. 22개 과제에서 성공률을 1차 연습 28.6%에서 15차 연습 95.0%까지 올렸고, 실물 로봇 30번의 시험은 모두 성공했다.
핵심 요약
- 오프라인 데이터로 시뮬레이터 연습 과제를 자동 만들고, 실패 진단으로 스킬 라이브러리와 프롬프트를 고치는 RPG 프레임워크를 제안했다.
- 모델 가중치를 바꾸지 않고 스킬·프롬프트만 개선했는데도 22개 과제 성공률을 28.6%에서 95.0%로 올렸다.
- 기존 최고 기준인 ASPIRE(75.5%)와 GPT-6 기반 에이전트(60.0%)를 모두 큰 차이로 앞섰다.
- 스킬 수정은 같은 라이브러리를 쓰는 다른 과제에도 도움이 되는 교차 과제 검증 후에만 반영했다.
- 보정 후 얼린 시스템으로 실물 로봇 3개 과제 30번 시험을 전부 성공했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.