InSight: Self-Guided Skill Acquisition via Steerable VLAs

발행일
출처
arXiv
논문 번호
482
분야
Robotics
arXiv 번호
2606.24884

VLA 로봇 정책을 원시 행동 단위로 조종 가능하게 만들고, VLM이 부족한 원시 행동을 자가 식별·수집·재학습하여 인간 데모 없이 새 기술을 습득하는 프레임워크 InSight를 제안한다.

Vision-Language-Action(VLA) 모델이 훈련 데이터에 없는 새로운 조작 기술을 자율적으로 습득할 수 있도록 하는 InSight 프레임워크를 제안한다. 1단계에서는 인간 데모를 자동으로 원시 행동(primitive) 단위로 분할해 VLA를 조종 가능하게 만들고, 2단계에서는 VLM이 새 태스크에 필요한 부족한 원시 행동을 식별하고 저수준 제어로 자율 시도→성공 롤아웃 수집→VLA 재학습하는 데이터 플라이휠을 구동한다. 블록 뒤집기, 서랍 닫기, 쓸기, 비틀기, 따르기 등 5개 태스크에서 인간 데모 없이 최대 96% 성공률을 달성했다.

핵심 요약

  • 인간 데모를 VLM 계획 분해와 엔드이펙터 궤적으로 자동 분할해 VLA를 원시 행동 수준에서 조종 가능하게 만듦
  • VLM이 새 태스크의 부족한 원시 행동을 식별하고 저수준 제어로 자율 시도→성공 데이터 수집→재학습하는 플라이휠 구축
  • 비틀기 92%, 따르기 96% end-to-end 성공률을 인간 데모 없이 달성 (CaP-X는 각각 32%, 16%)
  • 14개 원시 행동을 체인으로 하는 장기 과업(비틀기→따르기)에서 80% 성공률 달성
  • 새 원시 행동 추가 후에도 기존 pick-and-place 기술 100% 유지하여 망각 문제 없음을 확인
  • 화성 로봇 시나리오: 뜨기 데모만으로 쓸기 행동을 자율 습득하여 5/5 평가 성공

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)