Playful Agentic Robot Learning

발행일
출처
arXiv
논문 번호
457
분야
Robotics
arXiv 번호
2606.19419

로봇이 자율 유희를 통해 사전에 코드 기반 스킬을 학습하는 프레임워크 RATS. LIBERO-PRO에서 +20.6pp 향상, 다른 환경으로도 전이된다.

RATS(Robotics Agent Teams)는 Code-as-Policy 에이전트가 다운스트림 과제가 주어지기 전에 자율적으로 유희를 통해 재사용 가능한 스킬을 학습하는 시스템이다. 호기심 기반 과제 제안, 단계별 검증, 실패 진단, 스킬 라이브러리 축적의 파이프라인을 갖추며, LIBERO-PRO에서 CaP-Agent0 대비 +20.6pp(23.2%→43.8%), MolmoSpaces에서 +17.0pp 향상을 달성했다. 학습된 스킬은 다른 환경으로 전이되어 RoboSuite +8.9pp, 실제 로봇 +8.8pp 향상을 가져온다.

핵심 요약

  • 유희 시간에 자율적으로 과제 제안→실행→검증→진단→스킬 라이브러리 축적 파이프라인
  • novelty-learnability 규칙로 호기심 기반 과제 제안 (랜덤 유희 24.7% 대비 호기심 유희 32.3%)
  • LIBERO-PRO: CaP-Agent0 대비 +20.6pp (23.2%→43.8%), 모든 VLA baseline(π0.5 12.8%) 능가
  • 학습 스킬을 CaP-Agent0에 플러그인 시 RoboSuite +8.9pp, 실제 로봇 +8.8pp 향상
  • 단일 팔 환경에서 학습한 스킬이 양팔 과제(two-arm lifting +24.0pp)로도 전이
  • 호기심 유희 + 실행 시스템 개선이 상호 보완적 (둘 다 44.3%로 최고)

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)