LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation

발행일
출처
arXiv
논문 번호
814
분야
Robotics
arXiv 번호
2608.03701

이 논문은 단일 24GB GPU로 학습 가능한 가벼운 세계-행동 모델 LiLa-WAM을 제안해 로봇 조작에서 90% 성공률을 달성했다.

이 논문은 한마디로 로봇이 미래를 예측하면서 행동을 생성하는 가벼운 세계-행동 모델을 단일 GPU로 학습했다. 기존 세계 모델은 무거운 비디오 생성 백본을 쓰거나 여러 단계로 나뉘어 학습해 비용이 컸는데, LiLa-WAM은 잠재 공간에서 미래 상태와 행동을 동시에 예측하는 단일 스트림으로 이를 해결했다. 언어 없이 시각 특징만으로 태스크를 지정하는 VTT도 제안했다.

핵심 요약

  • 미래 상태 예측과 행동 생성을 하나의 스트림에서 통합한 경량 세계-행동 모델을 단일 24GB GPU로 학습했다.
  • 언어 없이 시각 특징 방향만으로 태스크를 지정하는 Visual Transition Token(VTT)을 제안했다.
  • RoboTwin 2.0 50개 태스크에서 90.48% 성공률로 파라미터 수 대비 압도적 효율성을 보였다.
  • LIBERO와 실제 로봇 실험에서도 큰 모델들과 경쟁할 수준을 확인했다.
  • DINOV3 비주얼 백본만 사용해 언어 모델 의존 없이도 효과적인 로봇 제어가 가능함을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)