LA4VLA: Learning to Act without Seeing via Language-Action Pretraining
- 발행일
- 출처
- arXiv
- 논문 번호
- 508
- 분야
- Robotics
- arXiv 번호
- 2606.27295
VLA 모델에서 시각 정보 없이 언어-행동만으로 사전학습하는 LA4VLA 프레임워크. 시각적 단축 의존도를 낮추고 언어 조건부 행동 사전을 학습한다.
LA4VLA는 기존 VLA 학습의 근본적 비대칭—시각-행동 신호는 조밀하지만 언어-행동 신호는 희소—를 해결한다. 전문가 데모를 원자 단위 행동 세그먼트로 분해하고 각각에 저수준 행동 설명을 페어링하여 33K LA 에피소드를 구축했다. 시각 입력을 완전히 제거한 상태에서 언어와 proprioceptive state만으로 행동을 예측하게 하면, 정책이 시각적 단축이 아닌 언어-조건부 행동 패턴을 학습하게 된다. 세 가지 사전학습 패러다임(LA-only, sequential LA-to-VLA, mixed LA-VLA)을 제안했고, mixed 사전학습 시뮬레이션에서 최대 17.8pp, 실제 로봇에서 45.0pp 향상을 달성했다. 특히 시각적 섭동 하에서 견고성이 크게 향상되어, 언어-행동 grounding의 중요성을 실증했다.
핵심 요약
- 기존 VLA 학습의 시각-언어 비대칭 문제 체계적 분석 (data-level + input-level asymmetry)
- 33K LA 에피소드를 추가 데이터 수집 없이 기존 데모에서 자동 구축 (LA4-33K)
- LA-only 사전학습이 동일 규모 VLA-only 사전학습보다 일관되게 우수
- mixed LA-VLA 사전학습: MetaWorld 87.53%, LIBERO 96.28%, 실제 로봇 83.3% 달성
- 시각 노이즈 하에서 LA 사전학습 정책이 VLA-only 대비 평균 25pp 높은 성공률
- LA 사전학습 정책의 t-SNE 분석에서 명령어 방향별로 명확히 분리된 표현 형성 확인
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.