LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

발행일
출처
arXiv
논문 번호
426
분야
Robotics
arXiv 번호
2606.15768

LaWAM은 latent world model을 통해 pixel-space 비디오 생성 없이 latent visual subgoal만으로 dynamics-aware 로봇 정책을 구현하는 효율적인 world-action model이다.

Latent Action Model의 forward decoder를 LaWM으로 재사용하여, 230M parameter만으로 latent action 기반 future observation feature를 예측한다. 정책이 예측한 latent action을 LaWM이 단일 forward pass로 latent subgoal로 변환하고, 이를 action expert에 조건으로 제공한다. LIBERO 98.6% SR, RoboTwin 91.22% SR을 달성하면서 pixel-space WAM 대비 최대 24× 낮은 지연(187ms)을 기록했다.

핵심 요약

  • LaWM: latent action model의 decoder를 재사용한 230M parameter latent world model (pixel-space WAM 대비 95% 적은 world-modeling parameter)
  • 단일 forward pass로 latent visual subgoal 예측 → 비iterative 추론으로 187ms 달성 (pixel-space WAM 대비 최대 24× 빠름)
  • 2단계 학습: Stage 1에서 약 3,000시간 로봇 + 1,500시간 egocentric 인간 영상으로 LaWM 학습, Stage 2에서 latent-action distillation 기반 정책 학습
  • 실제 환경 평가: Pick-and-Place 93.3%, Drawer Opening 86.7%, Towel Folding 90.0% (평균 90.0%로 모든 baseline 중 1위)

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)