TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

발행일
출처
arXiv
논문 번호
328
분야
Robotics
arXiv 번호
2606.06491

로봇 조작에서 실행 속도를 명시적으로 제어할 수 있는 VLA 모델로, 위험도에 따라 가감속을 동적으로 조절한다.

TempoVLA는 기존 VLA 모델이 학습 데모에서 단일 속도만 상속하는 한계를 극복해, 실행 속도를 명시적으로 제어할 수 있는 비전-언어-액션 정책이다. Variable-Speed Trajectory Augmentation(VSTA)으로 데모를 임의 속도로 재조정하고, 모델 측 컨디셔닝 메커니즘으로 속도를 정책에 주입한다. 대형 멀티모달 모델과 협력해 저위험 구간에서는 가속, 고위험 구간에서는 감속하는 동적 속도 제어를 실현한다.

핵심 요약

  • 기존 VLA는 고정 속도만 학습하지만, TempoVLA는 명시적 속도 조건으로 실행 속도를 제어한다.
  • VSTA 데이터 증강으로 데모를 임의 속도로 재조정하면서 운동 의미를 보존한다.
  • 시뮬레이션과 실제 환경 모두에서 양방향 유연한 속도 제어를 달성한다.
  • 대형 멀티모달 모델과 결합해 위험도 기반 동적 속도 제어를 실현한다.
  • VSTA는 기본 1x 속도 성능도 데이터 활용도 향상으로 개선한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)