Native Video-Action Pretraining for Generalizable Robot Control

발행일
출처
arXiv
논문 번호
585
분야
Robotics
arXiv 번호
2607.08639

로봇 제어를 위해 처음부터 설계된 비디오-액션 파운데이션 모델. 시각-액션 통합 토크나이저와 인과적 사전학습으로 225Hz 실시간 폐루프 제어를 달성한다.

LingBot-VA 2.0은 기존 비디오 생성 모델을 로봇 제어에 재사용하는 방식의 한계를 극복하고, 처음부터 embodied control을 목표로 설계된 비디오-액션 파운데이션 모델이다. 핵심 설계는 네 가지: (1) 시각 표현과 액션을 공유 잠재 공간에 정렬하는 의미론적 시각-액션 토크나이저(SemVAE), (2) 양방향→인과 변환 시 치명적 망각을 피하는 처음부터의 인과적(causal) 사전학습, (3) 모델 용량을 확장하면서도 효율성을 유지하는 sparse MoE 백본, (4) 예측과 실행을 병렬화하고 최신 관측으로 재정렬하는 Foresight Reasoning 비동기 추론이다. 실제 로봇 환경에서 10-15개 데모만으로 새 작업에 적응하며, π0.5 및 기존 LingBot-VA를 큰 폭으로 상회하는 성능을 보였다.

핵심 요약

  • 의미론적 시각-액션 토크나이저(SemVAE)로 시각 표현과 액션을 공유 잠재 공간에 정렬
  • 인과적(causal) 사전학습으로 양방향 아키텍처 적용 시의 치명적 망각 회피, 처음부터 scratch 학습
  • Sparse MoE 백본으로 모델 용량 확장하면서도 스텝당 활성 연산량은 유지
  • Foresight Reasoning 비동기 추론으로 225Hz 실시간 폐루프 제어 달성 (baseline 35Hz에서 6.5× 속도 향상)
  • 10-15개 데모로 few-shot 일반화 달성, π0.5 및 LingBot-VA 대비 시뮬레이션·실제 평가 모두 우수
  • 멀티청크 예측(MCP)으로 단기 시각 연속성이 아닌 궤적 수준 역학 학습 유도

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)