SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- 발행일
- 출처
- arXiv
- 논문 번호
- 853
- 분야
- Computer Vision
- arXiv 번호
- 2608.07468
자율주행에서 비디오 생성 모델을 학습 시간에만 쓰고 실제 운전 때는 빼버리는, 간단하면서도 성능 좋은 세계-행동 모델을 제안했다.
이 논문은 한마디로 자율주행 AI가 주행 궤적을 예측할 때, 비디오 생성 모델(미래 영상을 만드는 AI)을 학습할 때만 참고하고 실제 운전 때는 쓰지 않는 간단한 방법을 제안한다. 기존 세계-행동 모델(WAM)은 실시간으로 미래 영상을 만들면서 주행 판단을 해서 느렸다. SimWAM은 비디오 전문가와 행동 전문가를 함께 학습하되, attention 마스크로 행동 예측이 미래 프레임을 못 보게 막는다. 학습이 끝나면 비디오 부분을 통째로 빼버리고 가벼운 행동 모델만 남긴다. NAVSIM 벤치마크에서 91.5점으로 기존 최고 성능을 능가하면서도 추론 속도는 훨씬 빠르다.
핵심 요약
- 비디오 생성을 학습 시그널로만 쓰고 추론 때는 제거하는 'SimWAM' 구조를 제안했다. 실시간 비디오 생성이 필요 없어져서 추론이 빠르다.
- 비디오 전문가와 행동 전문가가 파라미터를 공유하지 않아, 비디오 모델을 더 좋은 것으로 교체하거나 행동 모델을 키우기 쉽다.
- NAVSIM 벤치마크에서 91.5 PDMS 달성. 기존 세계-행동 모델 기반 플래너보다 좋은 성능이면서 추론 지연은 크게 낮다.
- 강화학습(GRPO)을 추가로 적용해 궤적 모방을 넘어 복합적인 주행 보상을 최적화했다.
- nuScenes 데이터셋에 제로샷으로 전-transfer 가능하여 범용성도 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.