Pre-training Visual Dexterity in Simulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 1039
- 분야
- Robotics
- arXiv 번호
- 2608.15917
VR 시뮬레이터 안에서 사람이 로봇 손을 조종해 75시간 데이터를 모아 사전학습하고, 실제 로봇은 데모 1~2시간만으로 완성하는 방법.
이 논문은 한마디로 로봇 장비 없이 VR 시뮬레이션에서만 75시간 데이터를 모아 사전학습하고, 실제로는 데모 1~2시간 만으로 정교한 손 로봇을 가르치는 방법(SPD)이다. 다포수(손가락 많은) 로봇 손은 실제 데이터 수집이 비싸고 깨지기 쉬운데, VR 안이라면 빠른 리셋과 병렬 작업으로 저렴하게 쌓을 수 있다. 5명이 일주일간 모은 75시간 데이터로 정책을 사전학습한 뒤, 56자유도 양팔 손 로봇에서 파인튜닝했다. 접시 정리·젠가 등 5개 실과제 전부에서 처음부터 학습한 것보다 나았다.
핵심 요약
- VR 시뮬레이션 텔레오퍼레이션으로 실제 로봇 없이 일주일 만에 75시간·약 2000 에피소드의 손 조작 데이터를 모았다.
- 사전학습 후 실제 데모 1~2시간 파인튜닝만으로 5개 실과제 모두에서 처음부터 학습보다 나은 성적을 냈다.
- 과거 관찰 기록(히스토리)을 보게 하고 행동 조각을 짧게(8스텝) 끊는 설정이 반응성과 일관성을 동시에 잡았다.
- 히스토리+짧은 행동 조각 구성이 사전학습 덕을 가장 많이 봐서 처음부터 학습 대비 평균 18포인트 올랐다.
- 데이터셋(spd-75h)과 VR 수집 소프트웨어(spd-vr), 튜닝된 6개 씬을 공개했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.