Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 발행일
- 출처
- arXiv
- 논문 번호
- 262
- 분야
- Robotics
- arXiv 번호
- 2605.30280
Qwen Team이 개발한 Qwen-VLA는 로봇 조작 및 시각-언어 내비게이션 같은 다양한 체화 의사결정 문제를 단일 시각-언어-행동 모델로 통합한다.
Qwen-VLA는 로봇 조작, 시각-언어 내비게이션, 궤적 예측을 하나의 시각-언어-행동 모델로 통합한다. Qwen의 시각-언어 구조에 DiT 기반 행동 디코더를 붙이고, 로봇 궤적·사람 1인칭 영상·시뮬레이션·내비게이션·보조 시각언어 데이터를 함께 사전학습한다. 로봇별 몸체와 제어 규칙을 텍스트로 알려주는 조건을 사용해 팔, 이동 플랫폼 등 서로 다른 형태의 연속 행동을 같은 모델에서 생성한다. 여러 벤치마크에서 일관된 다중 과제 성능을 보였고, 실제 ALOHA의 분포 밖 조건에서 평균 성공률 76.9%, DOMINO 동적 조작에서 제로샷 성공률 26.6%를 보고했다. 그러나 평가는 여전히 비교적 짧고 정해진 벤치마크 중심이며, 장시간 실제 환경의 실패 복구와 촉각·힘 같은 물리 피드백은 후속 과제로 남아 있다.
핵심 요약
- 보조 시각-언어 데이터(8.5%): 모델이 장면을 묘사하거나 객체에 대해 추론하는 방법을 잊지 않도록 하는 범용 VLM 데이터다.
- 통합 구조: 공유 행동 전문가와 텍스트 조건화를 통해 하나의 모델이 다양한 체화 형태(팔, 손, 이동 베이스)를 제어할 수 있음을 입증한다.
- 모달리티 간 전이: 시각-언어 학습이 더 나은 객체 인식과 명령 파싱을 제공함으로써 로봇 행동에 직접적으로 도움이 됨을 보여준다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.