τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision
- 발행일
- 출처
- arXiv
- 논문 번호
- 736
- 분야
- Robotics
- arXiv 번호
- 2607.24485
촉각을 사전학습 VLA에 붙여 정밀 접촉 조작을 개선한 로봇 조작 연구다.
사전학습 VLA 모델에 촉각 감각을 결합한 프레임워크 타우를 제안한 논문이다. 미래 시각 특징을 예측하는 자기지도 학습을 훈련 단계에만 적용해 추론 비용 없이 촉각 표현을 개선했다. 플러그와 USB 삽입, 도장 찍기, 화이트보드 지우기 네 가지 접촉 위주 작업에서 시각 전용 VLA와 기존 촉각 정책을 모두 앞섰다. 미지의 물체와 장면에서도 일반화를 보였다.
핵심 요약
- 현재 촉각과 뒤따르는 행동으로 미래 시각 특징을 예측하는 자기지도 목표를 사용해 시공간 촉각 표현을 학습한다.
- 학습한 촉각 표현을 사전학습된 시각·언어 특징과 결합해 로봇 행동을 생성하며, 예측 가지는 훈련 때만 사용한다.
- 플러그와 USB 삽입 등 네 가지 접촉 중심 조작에서 시각 전용 VLA와 기존 촉각 정책보다 높은 성능을 보였다.
- 추론 때 추가 가지를 제거하므로 배포 비용을 늘리지 않으면서 접촉이 중요한 로봇 조작을 개선할 수 있다.
- 평가는 TacAura의 네 가지 대표 작업과 제한된 작업별 데이터에 집중되어 있어 더 다양한 로봇과 접촉 상황에서의 검증이 남아 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.