Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
- 발행일
- 출처
- arXiv
- 논문 번호
- 1058
- 분야
- Computer Vision
- arXiv 번호
- 2609.00111
자율주행용 비전-언어 파운데이션 모델. Qwen3.5-4B 구조를 바꾸지 않고 외부 모듈 두 개만 붙여 3D 인식·질의응답·경로 계획을 통합하고, 단계적 학습으로 일반 능력 소실을 막았다.
이 논문은 한마디로 범용 비전-언어 모델(Qwen3.5-4B)의 구조는 그대로 두고 외부 모듈 두 개만 붙여서, 3D 인식과 질의응답, 자율주행 경로 계획까지 한 모델이 다 하게 만든 연구다. BEV(조감도) 인식 헤드가 3D 물체 인식과 지도 그리기를 맡고, 계획 전문가(Planning Expert)가 미래 주행 경로를 생성한다. 운전 데이터와 범용 데이터를 섞어 단계별로 학습해서 주행 능력을 얻으면서도 원래의 범용 능력을 대부분 지켰다. nuScenes 3D 인식 43.95 mAP, NAVSIM 주행 점수 90.7 등으로 기존 방법들과 경쟁하는 성능을 냈다.
핵심 요약
- 사전학습 VLM(Qwen3.5-4B) 구조를 하나도 바꾸지 않고, BEV 인식 헤드와 계획 전문가(Planning Expert) 두 외부 모듈만 붙여 3D 인식·질의응답·경로 계획을 통합했다.
- BEV 헤드를 '3D 탐침(probe)'으로 써서, 모델이 텍스트 답변만 능숙한 게 아니라 실제 3D 장면 구조를 얼마나 아는지 검사 가능하게 만들었다.
- 운전 데이터와 범용 비전-언어 데이터를 섞는 단계적 학습으로 주행 능력과 일반 능력을 함께 유지해, 치명적 망각(새로 배우며 옛 능력을 잃는 문제)을 완화했다.
- nuScenes에서 3D 인식 43.95 mAP·지도 60.99 mIoU, NAVSIM 주행 점수(PDMS) 90.7, Waymo E2E 평가자 점수 7.91을 기록했다.
- 차량 내 콕핏(멀티미디어)과 주행 기능이 하나의 컴퓨팅 플랫폼을 공유하는 추세에 맞춰, 운전만 하는 모델이 아니라 다 같이 하는 모델을 지향했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.