ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 431
- 분야
- Robotics
- arXiv 번호
- 2606.17011
XPENG Robotics가 인간형 로봇 VLA 후속 학습에서 불완전한 인간 개입 데이터를 활용하는 ROVE RL 프레임워크를 제안했다. 혼합 품질 데이터에서 가치 기반 정책 추출로 실제 조작 작업에서 성능을 지속 향상시켰다.
인간형 로봇의 원격 조종 개입 데이터에 포함된 망설임·오류를 다루기 위해 Optimistic Value Estimation(OVE)을 도입하여 혼합 품질 궤적에서 고가치 행동을 추출한다. Cross-embodiment 인간 경험 영상을 critic 학습에 추가하여 long-tail 실패·회복 모드에 대한 감독을 보강했다. 화이트보드 지우기(접촉 다수)와 토스터에 빵 넣기(정밀 조작) 두 작업에서 3회 반복 개입으로 성공률이 각각 45.0%→80.0%, 56.7%→86.7%로 향상되었다.
핵심 요약
- 인간형 로봇 원격 조종 개입의 망설임·적응·회복 단계를 분해하여 혼합 품질 데이터 모델링
- Optimistic Value Estimation(OVE)으로 TD bootstrapping + expectile regression을 결합, 고가치 행동 우선 추출
- Cross-embodiment 인간 경험 영상을 critic 학습에 추가하여 long-tail 실패 모드 보강
- 실제 작업 3회 반복 개입으로 성공률 45→80%(화이트보드), 56.7→86.7%(토스터) 향상
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.