DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 756
- 분야
- Robotics
- arXiv 번호
- 2607.25918
이 논문은 로봇 세계-행동 모델(WAM)에서 비디오 예측을 '외관 재구성'에서 '상호작용 중심 역학'으로 바꾸면 로봇 정책 성능과 분포 외(OOD) 강건성이 크게 올라간다는 것을 보여준 연구다.
이 논문은 한마디로 로봇 WAM의 비디오 예측 브랜치를 '보이는 대로 재구성'에서 '무엇이 변하는가'로 초점을 바꿔서 로봇 조작 성능을 높였다. 핵심은 시간 차분(temporal-difference) 감독으로 정적인 외관 성분을 억제하고, 트래커 유도 가중치로 로봇 그리퍼·객체·접촉부 움직임에 집중하는 것이다. DynaRoute라는 어텐션 바이어스 모듈이 동적 관련 토큰에 집중하게 한다. LIBERO-Plus에서 60.9%로 기준선 대비 +7.1~+9.4%p 향상, 실제 로봇에서 조명/배경 변화 시에도 강건함을 보였다.
핵심 요약
- RGB 비디오평 시각적 감독을 외관 재구성에서 상호작중심 역학으로 재분배했다 — PSNR은 낮아지지만 정책 성능은 올라간다.
- 시간 차분 흐름 매칭 + 트래커 가이드 가중치로 정적인 배경/질감이 아닌 로봇-객체 접촉 움직임에 집중한다.
- DynaRoute 어텐션 바이어스가 동적 관련 토큰을 예측하고 시각 어텐션을 그쪽으로 유도한다.
- LIBERO-Plus(OOD)에서 60.9%로 FastWAM 대비 +9.4%p 향상, ID-OOD 성능 격차도 46.1→37.2로 축소했다.
- 실제 로봇 양팔 작업에서 조명 변화 시 최대 30%p 향상을 달성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.