Mulligan: Performance-Guided Data Collection for Efficient On-Robot Learning

발행일
출처
arXiv
논문 번호
1167
분야
Robotics
arXiv 번호
2610.05882

이 논문은 로봇이 실패한 상황에서 다시 데이터를 수집하게 해서, 한정된 사람 작업 시간으로 성공률을 크게 올리는 방법을 만들었다.

이 논문은 한마디로 로봇 학습 데이터를 "실패한 자리"에 집중해 모으면 같은 비용으로 훨씬 빨리 배운다는 방법이다. Mulligan은 매 라운드를 이전에 실패한 초기 상태와 안 가본 상태에서 시작하게 한다. 여기에 실패 데이터까지 버리지 않고 쓰는 가치함수를 더했다. 실제 로봇 작업 3종에서 최종 성공률을 10~34%p 올렸고, 사람 개입으로 수집 에피소드의 98%를 완료했다.

핵심 요약

  • 실패가 특정 초기 상태 25%에 95% 몰려 있어, 고르게 수집하면 사람 시간이 낭비된다는 걸 관찰했다.
  • 실패했던 상태를 다시 시도하고 덜 가본 상태를 채우는 방식으로 같은 예산에서 더 빨리 배웠다.
  • 실패 데이터까지 활용하는 가치함수 결합(HiL-IDQL+Mulligan)으로 실작업 성공률이 10~34%p 올랐다.
  • 검증을 2,550개의 블라인드 실측 에피소드로 수행해 신뢰도를 높였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)