InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

발행일
출처
arXiv
논문 번호
572
분야
Robotics
arXiv 번호
2607.04988

VLM 백본에 잠재 예지(foresight) 토큰과 동작 생성을 통합한 InternVLA-A1.5를 제안한다. 6개 시뮬레이션 벤치마크 전체 1위, 실세계 compositional generalization에서 최강을 기록했다.

InternVLA-A1.5는 VLM 백본(Qwen-3.5 2B)에 경량 통합 전문가를 결합하고, 학습 가능한 foresight 토큰으로 사전학습된 비디오 생성 모델(WAN2.2-5B)의 동역학 사전지식을 증류한다. 비디오 분기는 추론 시 제거되어 실시간 제어를 유지한다. 1.2M 로봇 에피소드로 사전학습 후 6개 시뮬레이션 벤치마크에서 전체 최고 성능을 달성했으며, 실세계에서 가장 강한 조합 일반화를 보였다.

핵심 요약

  • foresight 토큰: 학습 중에만 비디오 생성 모델(WAN2.2-5B)로 감독, 추론 시 제거로 실시간 속도 유지
  • VLM 백본에 VQA·서브태스크 예측·이산 동작 토큰 목표를 지속 훈련하여 의미론 능력 보존·강화
  • 6개 시뮬레이션 벤치마크(LIBERO 98.9%, RoboTwin 93.2%, SimplerEnv 80.8% 등) 전체 1위
  • LIBERO-Plus 제로샷 84.8%, DOMINO 제로샷 27.7%로 분포 이동·동적 객체 상호작용에서 강건성 입증
  • foresight 토큰 제거 시 DOMINO 23.8%로 하락, 동역학 사전지식 전달의 효과 확인

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)