Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 1011
- 분야
- Robotics
- arXiv 번호
- 2608.24885
이 논문은 로봇 세계 모델이 시킨 대로 움직이는지를 전문가 시연 밖의 행동까지 넣어 진단하는 평가 도구를 만들고, 거기서 드러난 약점을 메우는 학습법으로 정책 성공률을 끌어올렸다.
이 논문은 한마디로 '세계 모델이 정말 행동을 따르는지 캐묻고 고치는 연구'다. 지금까지 평가는 대부분 전문가 시연 범위 안에서만 이뤄져, 그 밖의 행동을 넣었을 때 무슨 일이 생기는지는 제대로 확인되지 않았다. WorldEcho는 다섯 갈래의 행동 질의를 넣고 생성된 영상이 멀쩡한지와 말단 장치 궤적이 맞는지를 함께 본다. 진단해 보니 기존 모델들은 전문가 행동은 그럭저럭 따르지만, 그 밖의 행동에서는 지시를 무시하거나 팔이 뭉개지는 식으로 무너졌다. 이를 메우는 WorldSync는 시뮬레이션 과제 성공률을 51~52%에서 65%로, 실제 로봇 컵 쌓기에서는 48%에서 68%로 올렸다.
핵심 요약
- WorldEcho는 시연 행동에 더해 다른 상태 재생, 국소 변형, 정책 롤아웃, 실행 가능 공간 표집이라는 네 가지 비전문가 행동 질의로 세계 모델을 찔러 본다.
- WorldSync는 행동 결과의 분포를 넓히고, Action-Forcing Expert로 중간 영상 표현을 로봇 움직임에 붙들어 매고, 행동을 바꿨을 때의 변화가 실제 미래의 변화와 맞도록 정렬한다.
- RoboTwin 50개 과제에서 WorldSync는 시각 무결성을 반영한 오차 0.0661로 가장 낮았고 영상 통과율 84.51%로 가장 높았다.
- 이 모델을 학습된 시뮬레이터로 써서 정책을 두 번 개선하자 시뮬레이션 성공률이 51~52%에서 65%로, 실제 로봇 컵 쌓기는 48%에서 68%로 올라 비교 대상 CtrlWorld보다 각각 8~9점과 12점 앞섰다.
- 다만 개별 지표를 따로 보면 우위가 고르지 않아 원시 NDTW는 Cosmos-Predict2.5가 0.013으로 더 좋았고, 저자들도 긴 시간에 걸친 상호작용과 여러 로봇 몸체까지 넓히는 일은 아직 과제로 남는다고 밝혔다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.