Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack
- 발행일
- 출처
- arXiv
- 논문 번호
- 415
- 분야
- Robotics
- arXiv 번호
- 2606.14409
Tencent이 공개한 HyVLA-0.5로, 데이터 수집부터 실제 로봇 배포까지 전체 스택을 아우르는 엔드투엔드 VLA 시스템이다.
Hy-Embodied-0.5-VLA(HyVLA-0.5)는 데이터 수집 하드웨어(커스텀 fingertip UMI + 모션캡처 케이지), flow-matching action expert를 갖춘 MoT 백본, delta-chunk 행동 표현, FlowPRO라는 critic-free RL 후처리, 그리고 비동기 추론 파이프라인을 하나로 통합한 로봇 학습 스택이다. 10,000시간의 자체 수집 egocentric UMI 데이터로 사전학습하며, 단일 체크포인트에서 JAKA, Astribot, Unitree G1 등 다양한 로봇으로 크로스바디 전이를 달성한다. 데이터·모델·RL·배포를 co-design했다는 점이 핵심 차별점이다.
핵심 요약
- 10K 시간의 sub-mm 정밀도 egocentric UMI 데이터를 자체 수집하여 사전학습+후처리 모두에 재사용
- Hy-Embodied-0.5 MoT 백본에 flow-matching action expert와 compact memory encoder를 결합, delta-chunk 표현으로 kinematics 독립성 확보
- FlowPRO: critic·reward model 없이 성공/실패 쌍에서 직접 학습하는 offline RL 후처리로 near-ceiling 성공률 달성
- Track-A(타겟 로봇 적응)와 Track-B(UMI-only 크로스바디 전이) 2개 SFT 트랙으로 다양한 로봇 플랫폼에 배포
- 비동기 추론 + cubic Bézier 궤적 평활화로 고주파 폐루프 제어 구현, 2K시간 UMI 데이터 서브셋 공개 예정
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.