AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control
- 발행일
- 출처
- arXiv
- 논문 번호
- 1130
- 분야
- Robotics
- arXiv 번호
- 2609.30264
이 논문은 '다음 장면 예측을 잘하는 세계 모델'이 왜 로봇 행동 선택에는 실패하는지 밝히고, 행동 정보를 보존하는 학습(AD-WM)으로 제어 성공률을 크게 올렸다.
이 논문은 한마디로 로봇용 세계 모델의 함정을 짚고 해결한 연구다. 세계 모델은 보통 '실제로 일어난 다음 장면'을 맞추도록 배우는데, 계획 수립은 '같은 상태에서 다른 행동들을 비교'하는 일이라 서로 어긋난다. AD-WM은 역학(inverse dynamics)으로 행동을 복원하게 하고 정규화된 복원 목표를 더해, 예측 속에 행동 정보가 남도록 학습한다. 보조 장치들은 테스트 때 버리므로 계획 수립 방식 자체는 그대로다. 그 결과 어려운 시작 상태에서 성공률이 3.7%에서 52.0%로 뛰었고, 실제 로봇 팔 픽앤드플레이스도 42.2%에서 71.1%로 올랐다.
핵심 요약
- '사실 예측 오차가 낮다 ≠ 행동 선택을 잘한다'라는 세계 모델의 구조적 문제를 정확히 짚었다.
- 행동 복원(역학) 보조 과제를 학습에만 붙여 예측이 행동 정보를 잃지 않게 했고, 테스트 때는 떼어내 계획 수립을 그대로 유지한다.
- OGBench-Cube 어려운 시작 상태에서 성공률 3.7% → 52.0%, 실제 Franka 로봇 픽앤드플레이스 42.2% → 71.1%를 기록했다.
- 단순 예측 오차 대신 '엘리트 후회(elite regret)' 같은 진단 지표가 실제 성공과 더 잘 맞는다는 것도 보여줬다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.