MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

발행일
출처
arXiv
논문 번호
388
분야
Robotics
arXiv 번호
2606.09215

실시간 휴머노이드 loco-manipulation을 위한 MotionWAM. 비디오 월드 모델의 중간 denoising 특징으로 정책을 구동하며, 통합 모션 잠재 변수로 전신 제어를 단일 공간에서 수행한다.

MotionWAM은 단일 egocentric 카메라에서 실시간으로 휴머노이드 전신 loco-manipulation을 수행하는 World Action Model이다. 비디오 DiT의 중간 denoising 특징으로 모션 DiT를 구동하고, 상하체 분할 대신 통합 모션 잠재 변수로 보행·몸통·높이 조절·발 상호작용·손 조작을 단일 공간에서 예측한다. 3단계 학습으로 점진적으로 특화한다. Unitree G1의 9개 실제 태스크에서 VLA 베이스라인 대비 30% 이상 높은 성공률을 달성하며 4.9Hz로 실시간 구동한다.

핵심 요약

  • 비디오 DiT 중간 denoising 특징을 정책 조건으로 활용, 전체 비디오 생성 불필요로 실시간 달성
  • 상하체 분할 대신 통합 모션 잠재 변수로 전신을 단일 공간에서 제어
  • 3단계 학습: egocentric 비디오 사전학습(2136시간) → 크로스 바디 후학습 → 전신 파인튜닝
  • Unitree G1에서 9개 태스크 평균 76.1% 성공률 (최강 VLA 베이스라인 43.9% 대비 32%p+ 향상)
  • 태스크 구동 발 상호작용(공 차기, 페달 밟기) 가능, 분할 정책으로는 불가능한 행동
  • NVIDIA A100에서 4.9Hz, Cosmos Policy(0.7Hz) 대비 7배 빠른 실시간 구동

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)