Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack

발행일
출처
arXiv
논문 번호
415
분야
Robotics
arXiv 번호
2606.14409

Tencent이 공개한 HyVLA-0.5로, 데이터 수집부터 실제 로봇 배포까지 전체 스택을 아우르는 엔드투엔드 VLA 시스템이다.

Hy-Embodied-0.5-VLA(HyVLA-0.5)는 데이터 수집 하드웨어(커스텀 fingertip UMI + 모션캡처 케이지), flow-matching action expert를 갖춘 MoT 백본, delta-chunk 행동 표현, FlowPRO라는 critic-free RL 후처리, 그리고 비동기 추론 파이프라인을 하나로 통합한 로봇 학습 스택이다. 10,000시간의 자체 수집 egocentric UMI 데이터로 사전학습하며, 단일 체크포인트에서 JAKA, Astribot, Unitree G1 등 다양한 로봇으로 크로스바디 전이를 달성한다. 데이터·모델·RL·배포를 co-design했다는 점이 핵심 차별점이다.

핵심 요약

  • 10K 시간의 sub-mm 정밀도 egocentric UMI 데이터를 자체 수집하여 사전학습+후처리 모두에 재사용
  • Hy-Embodied-0.5 MoT 백본에 flow-matching action expert와 compact memory encoder를 결합, delta-chunk 표현으로 kinematics 독립성 확보
  • FlowPRO: critic·reward model 없이 성공/실패 쌍에서 직접 학습하는 offline RL 후처리로 near-ceiling 성공률 달성
  • Track-A(타겟 로봇 적응)와 Track-B(UMI-only 크로스바디 전이) 2개 SFT 트랙으로 다양한 로봇 플랫폼에 배포
  • 비동기 추론 + cubic Bézier 궤적 평활화로 고주파 폐루프 제어 구현, 2K시간 UMI 데이터 서브셋 공개 예정

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)