FACT: Failure-Aware Causal Training for World-Action Models

발행일
출처
arXiv
논문 번호
892
분야
Robotics
arXiv 번호
2608.10232

이 논문은 로봇의 실패 행동을 버리지 않고 그 결과를 학습해, 잘못된 행동 뒤의 미래를 예측하고 필요하면 더 나은 행동 후보를 고를 수 있게 한 FACT를 제안했다.

이 논문은 한마디로 로봇이 성공 사례뿐 아니라 실패의 결과에서도 배우게 만든다. 월드 액션 모델은 로봇 행동과 그 뒤의 미래를 함께 예측하는 모델이다. FACT는 먼저 행동을 만들고, 실제로 실행한 행동을 조건으로 미래 영상과 과제 진행도를 예측한다. 실패 궤적에서는 잘못된 행동을 따라 하는 학습은 끄고, 실제로 관찰된 실패 미래와 실패가 시작된 뒤 낮춘 과제 진행도 값을 학습시킨다. 이렇게 학습한 진행도 예측값은 여러 행동 후보 중 더 나은 것을 고르는 데도 쓸 수 있다.

핵심 요약

  • 행동을 먼저 만든 뒤 그 행동을 조건으로 미래 영상과 진행도를 예측하며, 실패 행동은 모방하지 않고 결과 예측에만 사용한다.
  • RoboTwin 50개 과제에서 평균 성공률은 영상 공동 학습 없이 81.8%, 영상 공동 학습 시 85.6%, 실패 자료까지 넣었을 때 87.5%였다.
  • 실제 양팔 로봇에서 학습 때 본 과제는 82%에서 89%, 처음 보는 변형 과제는 67%에서 77%로 올랐다.
  • 실패 사례의 영상 예측 PSNR은 19.51에서 25.92로 올랐고, 성공 사례는 26.12와 26.08로 거의 같아 정상 예측은 유지됐다.
  • 행동 후보 4개를 진행도로 평가하면 본 과제 92%, 새 변형 과제 82%였지만 후보 평가를 위한 추가 계산이 필요하다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)