From Foundation to Application: Improving VLA Models in Practice
- 발행일
- 출처
- arXiv
- 논문 번호
- 574
- 분야
- Robotics
- arXiv 번호
- 2607.06403
LingBot-VLA 2.0은 6만 시간 데이터로 20종 로봇을 학습한 확장형 VLA 모델로, 전신 자유도 제어와 예측 역학 모델링을 통해 실제 로봇 적용 격차를 해소한다.
LingBot-VLA 2.0은 실제 환경 적용을 위해 세 가지 개선을 제시한다. 6만 시간 규모(로봇 5만 시간+자기중심 영상 1만 시간, 20종 로봇)의 데이터 처리 파이프라인을 재설계했고, 머리·허리·이동 베이스·손을 포함한 확장 행동 공간을 지원하며, 비디오 표현 모델과 깊이 추정을 활용한 예측 역학 모델링을 프록시 태스크로 도입했다. GM-100 벤치마크에서 일반화 성능이 향상되었고, 두 로봇 플랫폼에서 장기 이동 조작 능력을 입증했다.
핵심 요약
- 약 60,000시간(로봇 궤적 50,000시간 + 자기중심 영상 10,000시간)의 대규모 사전학습 데이터 구축, 20종 로봇 구성 포함
- 팔뿐 아니라 머리·허리·이동 베이스·능동 손까지 확장된 전신 자유도 제어 지원
- 비디오 표현 모델(semantic prior)과 깊이 추정 모델(geometric cue)을 활용한 이중 쿼리 증류 기반 예측 역학 모델링 도입
- GM-100 듀얼암 벤치마크 4종 태스크 평균 성공률 55.0%(MeanStd 정규화+L2 손실 기준), 가장 높은 태스크는 76.8%
- 상대 행동 타겟(relQpos)이 절대 타겟 대비 행동 스케일을 0.34배로 압축하여 학습 안정성 향상
- MoE 기반 액션 전문가 구조로 토큰 수준 적응형 전문가 라우팅 적용
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.