From Foundation to Application: Improving VLA Models in Practice

발행일
출처
arXiv
논문 번호
574
분야
Robotics
arXiv 번호
2607.06403

LingBot-VLA 2.0은 6만 시간 데이터로 20종 로봇을 학습한 확장형 VLA 모델로, 전신 자유도 제어와 예측 역학 모델링을 통해 실제 로봇 적용 격차를 해소한다.

LingBot-VLA 2.0은 실제 환경 적용을 위해 세 가지 개선을 제시한다. 6만 시간 규모(로봇 5만 시간+자기중심 영상 1만 시간, 20종 로봇)의 데이터 처리 파이프라인을 재설계했고, 머리·허리·이동 베이스·손을 포함한 확장 행동 공간을 지원하며, 비디오 표현 모델과 깊이 추정을 활용한 예측 역학 모델링을 프록시 태스크로 도입했다. GM-100 벤치마크에서 일반화 성능이 향상되었고, 두 로봇 플랫폼에서 장기 이동 조작 능력을 입증했다.

핵심 요약

  • 약 60,000시간(로봇 궤적 50,000시간 + 자기중심 영상 10,000시간)의 대규모 사전학습 데이터 구축, 20종 로봇 구성 포함
  • 팔뿐 아니라 머리·허리·이동 베이스·능동 손까지 확장된 전신 자유도 제어 지원
  • 비디오 표현 모델(semantic prior)과 깊이 추정 모델(geometric cue)을 활용한 이중 쿼리 증류 기반 예측 역학 모델링 도입
  • GM-100 듀얼암 벤치마크 4종 태스크 평균 성공률 55.0%(MeanStd 정규화+L2 손실 기준), 가장 높은 태스크는 76.8%
  • 상대 행동 타겟(relQpos)이 절대 타겟 대비 행동 스케일을 0.34배로 압축하여 학습 안정성 향상
  • MoE 기반 액션 전문가 구조로 토큰 수준 적응형 전문가 라우팅 적용

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)