Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
- 발행일
- 출처
- arXiv
- 논문 번호
- 660
- 분야
- Robotics
- arXiv 번호
- 2607.15330
10만 시간 이상의 실제 로봇 조작 데이터로 학습한 VLA 파운데이션 모델이다. 새 환경에서 제로샷 동작하고 소량 데이터로 새 작업을 학습한다.
이 논문은 한마디로 10만 시간 넘는 실제 로봇 조작 궤적으로 학습한 VLA(비전-언어-행동) 파운데이션 모델이다. 사전학습에는 UMI 기기로 수집한 대규모 궤적 데이터를 쓰고, 자동 라벨링 파이프라인으로 장면 변화를 자연어로 주석 단다. 후속학습에서 로봇 본체에 맞춰 정렬한다. RoboCasa365에서 57.6% 성공률로 종전 최고(46.6%)를 크게 뛰어넘었다.
핵심 요약
- 10만 시간 이상의 UMI 실제 조작 궤적에 VLM 기반 자동 라벨링 파이프라인을 적용했다.
- 사전학습 단계에서 데이터와 모델 크기를 키울수록 성능이 일관되게 향상되는 스케일링 동작을 보였다.
- RoboCasa365에서 57.6%로 종전 최고(46.6%)를 갱신했다.
- 실제 로봇에서 10시간 이내 데이터로 새 작업을 평균 75% 성공률로 학습했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.