Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning

발행일
출처
arXiv
논문 번호
981
분야
Robotics
arXiv 번호
2608.21204

로봇이 사람 시범 따라 하기만 하는 모방학습(BC)의 한계를, 거대 정책은 얼려두고 작은 Q함수(행동 가치 평가기)만 실패 경험으로 업데이트해 스스로 성장하게 만드는 방법으로 푼 논문이다.

이 논문은 한마디로 로봇 팔 정책이 자기 실패 영상에서 스스로 배우게 만든 연구다. 기존 모방 학습(BC, 사람 시범을 따라 하기만 하는 학습)은 성공 데이터로만 훈련되어 배포 중 생긴 실패에서 배우지 못한다. 저자들은 정책은 그대로 얼려두고, 성공·실패 모두에서 배울 수 있는 작은 Q함수만 온라인으로 업데이트하는 Q-Planning을 제안했다. 시뮬레이션에서 10번의 자기개선 반복으로 모든 벤치마크가 올랐고(LIBERO-10 93%→99%), 실제 양팔 로봇에서도 컵 쌓기 40%→90%, 지갑에 카드 넣기 25%→80%까지 개선됐다.

핵심 요약

  • 거대 로봇 정책(수십억 파라미터)은 얼려두고 약 10억 파라미터 Q함수만 갱신하니, 자기개선 비용이 정책 크기가 아니라 평가기 크기에 비례하게 만들었다.
  • Q함수는 성공·실패 굴리기를 모두 흡수할 수 있어, 성공 데이터만 재학습하는 SFT가 55%/30%에서 멈춘 실물 과업을 90%/80%까지 끌어올렸다.
  • 추론 시 정책이 뽑은 64개 후보 행동을 Q점수로 가중 평균하는 한 번의 계획 단계(400ms)로 처리해 실시간 제어 예산 안에 들어왔다.
  • 동일한 온라인 예산에서 Best-of-N·필터 SFT·IBRL·DSRL·DAWR 대비 유일하게 실패로부터 안정적으로 성능이 오르는 방법이었다.
  • 기본 정책이 아예 성공 후보를 만들어내지 못하는 과업은 여전히 못 풀고, 에피소드별 성공 판정기가 필요하다는 한계도 분명히 밝혔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)