InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
- 발행일
- 출처
- arXiv
- 논문 번호
- 572
- 분야
- Robotics
- arXiv 번호
- 2607.04988
VLM 백본에 잠재 예지(foresight) 토큰과 동작 생성을 통합한 InternVLA-A1.5를 제안한다. 6개 시뮬레이션 벤치마크 전체 1위, 실세계 compositional generalization에서 최강을 기록했다.
InternVLA-A1.5는 VLM 백본(Qwen-3.5 2B)에 경량 통합 전문가를 결합하고, 학습 가능한 foresight 토큰으로 사전학습된 비디오 생성 모델(WAN2.2-5B)의 동역학 사전지식을 증류한다. 비디오 분기는 추론 시 제거되어 실시간 제어를 유지한다. 1.2M 로봇 에피소드로 사전학습 후 6개 시뮬레이션 벤치마크에서 전체 최고 성능을 달성했으며, 실세계에서 가장 강한 조합 일반화를 보였다.
핵심 요약
- foresight 토큰: 학습 중에만 비디오 생성 모델(WAN2.2-5B)로 감독, 추론 시 제거로 실시간 속도 유지
- VLM 백본에 VQA·서브태스크 예측·이산 동작 토큰 목표를 지속 훈련하여 의미론 능력 보존·강화
- 6개 시뮬레이션 벤치마크(LIBERO 98.9%, RoboTwin 93.2%, SimplerEnv 80.8% 등) 전체 1위
- LIBERO-Plus 제로샷 84.8%, DOMINO 제로샷 27.7%로 분포 이동·동적 객체 상호작용에서 강건성 입증
- foresight 토큰 제거 시 DOMINO 23.8%로 하락, 동역학 사전지식 전달의 효과 확인
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.