Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs

발행일
출처
arXiv
논문 번호
559
분야
Robotics
arXiv 번호
2607.02466

VLA 모델에서 '움직이는 법'과 '할 일'을 분리해 task-agnostic 데이터로 사전학습하는 프레임워크.

Vision-Language-Action(VLA) 모델의 전문가 시연 데이터 병목을 해결하기 위해 Task-Agnostic Pretraining(TAP)을 제안한다. 핵심 가설인 Decomposition Hypothesis는 물리적 역량(how to move)과 의미 정렬(what to do)이 분리 가능하며, 전자는 언어 없이 학습 가능하다는 것이다. 1단계에서 역동역학(inverse dynamics) 목적함수로 task-agnostic 데이터에서 운동 사전을 학습하고, 2단계에서 소량의 전문가 데이터로 언어 정렬을 수행한다. SIMPLER 벤치마크에서 1M+ 전문가 트라젝토리 모델과 동등한 성능을 달성하면서도 행동 복제 대비 10% 절대 향상을 보였다.

핵심 요약

  • Decomposition Hypothesis: 'how to move'(물리)와 'what to do'(의미) 분리, 후자만 언어 필요
  • 역동역학 목적함수로 관계없는 궤적/자율 주행 데이터에서 물리적 사전 학습
  • SIMPLER: 1M+ 전문가 데이터 모델과 동등, 행동 복제 대비 +10% 절대 향상
  • 실제 WidowX: 카메라 교란 시 인터넷 스케일 baseline(0%) 대비 25% 성공률 유지
  • partial success 31.8%→45.8%: 물리적 사전의 전이 가능성 입증
  • Stage 1 스케일이 성능 상한을 결정, Stage 2 연장은 한계 수익 체감

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)