Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

발행일
출처
arXiv
논문 번호
660
분야
Robotics
arXiv 번호
2607.15330

10만 시간 이상의 실제 로봇 조작 데이터로 학습한 VLA 파운데이션 모델이다. 새 환경에서 제로샷 동작하고 소량 데이터로 새 작업을 학습한다.

이 논문은 한마디로 10만 시간 넘는 실제 로봇 조작 궤적으로 학습한 VLA(비전-언어-행동) 파운데이션 모델이다. 사전학습에는 UMI 기기로 수집한 대규모 궤적 데이터를 쓰고, 자동 라벨링 파이프라인으로 장면 변화를 자연어로 주석 단다. 후속학습에서 로봇 본체에 맞춰 정렬한다. RoboCasa365에서 57.6% 성공률로 종전 최고(46.6%)를 크게 뛰어넘었다.

핵심 요약

  • 10만 시간 이상의 UMI 실제 조작 궤적에 VLM 기반 자동 라벨링 파이프라인을 적용했다.
  • 사전학습 단계에서 데이터와 모델 크기를 키울수록 성능이 일관되게 향상되는 스케일링 동작을 보였다.
  • RoboCasa365에서 57.6%로 종전 최고(46.6%)를 갱신했다.
  • 실제 로봇에서 10시간 이내 데이터로 새 작업을 평균 75% 성공률로 학습했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)