DreamWAM: Beyond RGB Future Prediction for World Action Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 822
- 분야
- Robotics
- arXiv 번호
- 2608.04996
로봇 행동 모델이 미래를 예측할 때 단순 RGB 대신 움직임·깊이·의미를 함께 학습하면, 보이지 않는 환경 변화에 훨씬 강해진다는 것을 보였다.
이 논문은 한마디로 로봇이 미래를 상상할 때 픽셀(RGB)만 예측하지 말고 움직임, 깊이, 의미까지 함께 예측하면 훨씬 강해진다는 연구다. 기존 World Action Model은 미래를 RGB로만 예측해서 조명이나 배경이 바뀌면 취약했다. DreamWAM은 학습 때만 추가 정보를 쓰고 실제 사용 때는 RGB만 쓰므로 배포 비용이 늘지 않는다. LIBERO 환경에서 성공률을 올렸고, 특히 unseen 변화에 대한 강건성이 크게 향상되었다.
핵심 요약
- 미래 예측을 RGB에서 움직임(optical flow), 깊이, 의미 정보로 확장하여 로봇 행동 모델의 강건성을 크게 높였다.
- 학습 때만 추가 정보를 사용하고 추론 때는 RGB만 쓰므로 배포 비용이 늘지 않는다.
- LIBERO 표준에서 97.3%→98.4%로 소폭 향상, unseen 변화(LIBERO-Plus)에서는 51.4%→63.4%로 대폭 개선했다.
- 실제 로봇 실험에서도 표준 90.8%→96.7%, perturbation 55.6%→74.4%로 강건성 이득이 일관되게 나타났다.
- 세 가지 보조 정보 중 움직임이 가장 중요하며, 깊이와 의미는 residual 방식으로 주입하는 것이 최적이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.