DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

발행일
출처
arXiv
논문 번호
627
분야
Robotics
arXiv 번호
2607.13033

로봇 조작 dense reward model, 자동 실패 합성으로 프레임 단위 보상 학습.

Reach/Grasp/Lift/Move/Place 5단계로 manipulation을 정의하고 각 단계에서 타겟 섭동을 가해 충돌, 그랩 실패, 낙하, 회복 등 6가지 물리적 실패 모드를 자동 합성한다. 27k 에피소드에 dense frame-level reward label을 부여한다. DROID, Isaac Sim, RoboSuite, LIBERO에서 데이터를 구축했으며 실패 데이터 포함 시 MAE 0.0809 vs 제외 시 0.1312를 기록했다. MPC 가이드에서 평균 최소 거리 0.229로 RoboReward(0.267), VLAC(0.347)를 능가했다. 실제 Franka 로봇 DSRL에서 stack cups 40%to80%, ball in basket 30%to70%를 단 10-20 rollout로 달성했다.

핵심 요약

  • 시뮬레이션에서 충돌, 잡기 실패, 물체 낙하, 복구 같은 물리적 실패 궤적을 사람 라벨 없이 자동 합성했다.
  • 시각 관측과 언어 지시를 받아 매 프레임의 작업 진행도를 점수로 내는 촘촘한 보상 모델을 학습했다.
  • 시뮬레이션과 실제 조작 모두에서 범용 VLM과 기존 로봇 보상 모델보다 정확한 촘촘한 보상 예측을 보였다.
  • 이 보상은 모델 예측 제어와 강화학습에 세밀한 진행 신호를 제공해 모방학습 뒤의 로봇 정책 개선에 활용할 수 있다.
  • 현재 범위는 비교적 짧은 조작에 집중되며 도구 사용과 장기 작업, 사람 선호를 반영한 보상은 후속 과제로 남아 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)