Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs
- 발행일
- 출처
- arXiv
- 논문 번호
- 559
- 분야
- Robotics
- arXiv 번호
- 2607.02466
VLA 모델에서 '움직이는 법'과 '할 일'을 분리해 task-agnostic 데이터로 사전학습하는 프레임워크.
Vision-Language-Action(VLA) 모델의 전문가 시연 데이터 병목을 해결하기 위해 Task-Agnostic Pretraining(TAP)을 제안한다. 핵심 가설인 Decomposition Hypothesis는 물리적 역량(how to move)과 의미 정렬(what to do)이 분리 가능하며, 전자는 언어 없이 학습 가능하다는 것이다. 1단계에서 역동역학(inverse dynamics) 목적함수로 task-agnostic 데이터에서 운동 사전을 학습하고, 2단계에서 소량의 전문가 데이터로 언어 정렬을 수행한다. SIMPLER 벤치마크에서 1M+ 전문가 트라젝토리 모델과 동등한 성능을 달성하면서도 행동 복제 대비 10% 절대 향상을 보였다.
핵심 요약
- Decomposition Hypothesis: 'how to move'(물리)와 'what to do'(의미) 분리, 후자만 언어 필요
- 역동역학 목적함수로 관계없는 궤적/자율 주행 데이터에서 물리적 사전 학습
- SIMPLER: 1M+ 전문가 데이터 모델과 동등, 행동 복제 대비 +10% 절대 향상
- 실제 WidowX: 카메라 교란 시 인터넷 스케일 baseline(0%) 대비 25% 성공률 유지
- partial success 31.8%→45.8%: 물리적 사전의 전이 가능성 입증
- Stage 1 스케일이 성능 상한을 결정, Stage 2 연장은 한계 수익 체감
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.