LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 814
- 분야
- Robotics
- arXiv 번호
- 2608.03701
이 논문은 단일 24GB GPU로 학습 가능한 가벼운 세계-행동 모델 LiLa-WAM을 제안해 로봇 조작에서 90% 성공률을 달성했다.
이 논문은 한마디로 로봇이 미래를 예측하면서 행동을 생성하는 가벼운 세계-행동 모델을 단일 GPU로 학습했다. 기존 세계 모델은 무거운 비디오 생성 백본을 쓰거나 여러 단계로 나뉘어 학습해 비용이 컸는데, LiLa-WAM은 잠재 공간에서 미래 상태와 행동을 동시에 예측하는 단일 스트림으로 이를 해결했다. 언어 없이 시각 특징만으로 태스크를 지정하는 VTT도 제안했다.
핵심 요약
- 미래 상태 예측과 행동 생성을 하나의 스트림에서 통합한 경량 세계-행동 모델을 단일 24GB GPU로 학습했다.
- 언어 없이 시각 특징 방향만으로 태스크를 지정하는 Visual Transition Token(VTT)을 제안했다.
- RoboTwin 2.0 50개 태스크에서 90.48% 성공률로 파라미터 수 대비 압도적 효율성을 보였다.
- LIBERO와 실제 로봇 실험에서도 큰 모델들과 경쟁할 수준을 확인했다.
- DINOV3 비주얼 백본만 사용해 언어 모델 의존 없이도 효과적인 로봇 제어가 가능함을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.