InSight: Self-Guided Skill Acquisition via Steerable VLAs
- 발행일
- 출처
- arXiv
- 논문 번호
- 482
- 분야
- Robotics
- arXiv 번호
- 2606.24884
VLA 로봇 정책을 원시 행동 단위로 조종 가능하게 만들고, VLM이 부족한 원시 행동을 자가 식별·수집·재학습하여 인간 데모 없이 새 기술을 습득하는 프레임워크 InSight를 제안한다.
Vision-Language-Action(VLA) 모델이 훈련 데이터에 없는 새로운 조작 기술을 자율적으로 습득할 수 있도록 하는 InSight 프레임워크를 제안한다. 1단계에서는 인간 데모를 자동으로 원시 행동(primitive) 단위로 분할해 VLA를 조종 가능하게 만들고, 2단계에서는 VLM이 새 태스크에 필요한 부족한 원시 행동을 식별하고 저수준 제어로 자율 시도→성공 롤아웃 수집→VLA 재학습하는 데이터 플라이휠을 구동한다. 블록 뒤집기, 서랍 닫기, 쓸기, 비틀기, 따르기 등 5개 태스크에서 인간 데모 없이 최대 96% 성공률을 달성했다.
핵심 요약
- 인간 데모를 VLM 계획 분해와 엔드이펙터 궤적으로 자동 분할해 VLA를 원시 행동 수준에서 조종 가능하게 만듦
- VLM이 새 태스크의 부족한 원시 행동을 식별하고 저수준 제어로 자율 시도→성공 데이터 수집→재학습하는 플라이휠 구축
- 비틀기 92%, 따르기 96% end-to-end 성공률을 인간 데모 없이 달성 (CaP-X는 각각 32%, 16%)
- 14개 원시 행동을 체인으로 하는 장기 과업(비틀기→따르기)에서 80% 성공률 달성
- 새 원시 행동 추가 후에도 기존 pick-and-place 기술 100% 유지하여 망각 문제 없음을 확인
- 화성 로봇 시나리오: 뜨기 데모만으로 쓸기 행동을 자율 습득하여 5/5 평가 성공
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.