ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 724
- 분야
- Robotics
- arXiv 번호
- 2607.22530
카메라만으로는 안 보이는 접촉 정보를 촉각 센서로补充하는 로봇 조작 월드 모델. 합성 데이터로 정책을 개선한다.
이 논문은 한마디로 로봇이 물건을 만질 때 발생하는 시각+촉각 정보를 동시에 예측하는 월드 모델 ViTacWorld다. 촉각 센서 데이터는 비싸고 모으기 힘들기 때문에, 공개 데이터와 시뮬레이션으로 대규모 사전학습을 한 뒤 실제 로봇 데이터로 파인튜닝하는 전략을 썼다. 이 모델은 로봇 액션이 주어지면 미래의 시각 장면과 촉각 신호를 동시에 생성할 수 있다. 생성된 합성 데이터로 하위 정책을 추가 학습하니 실제 로봇 작업 성공률이 크게 올라갔다. 예를 들어 π0.5+촉각 정책은 평균 성공률이 42.5%에서 67.5%로 향상되었다.
핵심 요약
- 최초로 로봇 액션 조건부 시각+촉각 월드 모델을 제안했으며, 시뮬레이션+실제 데이터 통합 학습 파이프라인을 구축했다.
- 촉각을 '추가적인 뷰'로 모델링하여 view-aware conditioning과 cross-view attention으로 시각-촉각 일관성을 유지한다.
- 생성된 롤아웃으로 정책을 추가 학습하자 π0.5+촉각 정책 평균 성공률이 42.5% → 67.5%로 +25%p 향상되었다.
- 사전학습 + 시뮬레이션 데이터가 PSNR, SSIM, LPIPS 모든 지표에서 생성 품질을 크게 높였다.
- 정책 평가 도구로도 활용 가능하여, 주어진 액션 시퀀스에 대한 시각+촉각 결과를 예측할 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.