Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning
- 발행일
- 출처
- arXiv
- 논문 번호
- 981
- 분야
- Robotics
- arXiv 번호
- 2608.21204
로봇이 사람 시범 따라 하기만 하는 모방학습(BC)의 한계를, 거대 정책은 얼려두고 작은 Q함수(행동 가치 평가기)만 실패 경험으로 업데이트해 스스로 성장하게 만드는 방법으로 푼 논문이다.
이 논문은 한마디로 로봇 팔 정책이 자기 실패 영상에서 스스로 배우게 만든 연구다. 기존 모방 학습(BC, 사람 시범을 따라 하기만 하는 학습)은 성공 데이터로만 훈련되어 배포 중 생긴 실패에서 배우지 못한다. 저자들은 정책은 그대로 얼려두고, 성공·실패 모두에서 배울 수 있는 작은 Q함수만 온라인으로 업데이트하는 Q-Planning을 제안했다. 시뮬레이션에서 10번의 자기개선 반복으로 모든 벤치마크가 올랐고(LIBERO-10 93%→99%), 실제 양팔 로봇에서도 컵 쌓기 40%→90%, 지갑에 카드 넣기 25%→80%까지 개선됐다.
핵심 요약
- 거대 로봇 정책(수십억 파라미터)은 얼려두고 약 10억 파라미터 Q함수만 갱신하니, 자기개선 비용이 정책 크기가 아니라 평가기 크기에 비례하게 만들었다.
- Q함수는 성공·실패 굴리기를 모두 흡수할 수 있어, 성공 데이터만 재학습하는 SFT가 55%/30%에서 멈춘 실물 과업을 90%/80%까지 끌어올렸다.
- 추론 시 정책이 뽑은 64개 후보 행동을 Q점수로 가중 평균하는 한 번의 계획 단계(400ms)로 처리해 실시간 제어 예산 안에 들어왔다.
- 동일한 온라인 예산에서 Best-of-N·필터 SFT·IBRL·DSRL·DAWR 대비 유일하게 실패로부터 안정적으로 성능이 오르는 방법이었다.
- 기본 정책이 아예 성공 후보를 만들어내지 못하는 과업은 여전히 못 풀고, 에피소드별 성공 판정기가 필요하다는 한계도 분명히 밝혔다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.