Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning

발행일
출처
arXiv
논문 번호
1011
분야
Robotics
arXiv 번호
2608.24885

이 논문은 로봇 세계 모델이 시킨 대로 움직이는지를 전문가 시연 밖의 행동까지 넣어 진단하는 평가 도구를 만들고, 거기서 드러난 약점을 메우는 학습법으로 정책 성공률을 끌어올렸다.

이 논문은 한마디로 '세계 모델이 정말 행동을 따르는지 캐묻고 고치는 연구'다. 지금까지 평가는 대부분 전문가 시연 범위 안에서만 이뤄져, 그 밖의 행동을 넣었을 때 무슨 일이 생기는지는 제대로 확인되지 않았다. WorldEcho는 다섯 갈래의 행동 질의를 넣고 생성된 영상이 멀쩡한지와 말단 장치 궤적이 맞는지를 함께 본다. 진단해 보니 기존 모델들은 전문가 행동은 그럭저럭 따르지만, 그 밖의 행동에서는 지시를 무시하거나 팔이 뭉개지는 식으로 무너졌다. 이를 메우는 WorldSync는 시뮬레이션 과제 성공률을 51~52%에서 65%로, 실제 로봇 컵 쌓기에서는 48%에서 68%로 올렸다.

핵심 요약

  • WorldEcho는 시연 행동에 더해 다른 상태 재생, 국소 변형, 정책 롤아웃, 실행 가능 공간 표집이라는 네 가지 비전문가 행동 질의로 세계 모델을 찔러 본다.
  • WorldSync는 행동 결과의 분포를 넓히고, Action-Forcing Expert로 중간 영상 표현을 로봇 움직임에 붙들어 매고, 행동을 바꿨을 때의 변화가 실제 미래의 변화와 맞도록 정렬한다.
  • RoboTwin 50개 과제에서 WorldSync는 시각 무결성을 반영한 오차 0.0661로 가장 낮았고 영상 통과율 84.51%로 가장 높았다.
  • 이 모델을 학습된 시뮬레이터로 써서 정책을 두 번 개선하자 시뮬레이션 성공률이 51~52%에서 65%로, 실제 로봇 컵 쌓기는 48%에서 68%로 올라 비교 대상 CtrlWorld보다 각각 8~9점과 12점 앞섰다.
  • 다만 개별 지표를 따로 보면 우위가 고르지 않아 원시 NDTW는 Cosmos-Predict2.5가 0.013으로 더 좋았고, 저자들도 긴 시간에 걸친 상호작용과 여러 로봇 몸체까지 넓히는 일은 아직 과제로 남는다고 밝혔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)