GeoWAM: Visual Geometry World Action Models for Autonomous Driving

발행일
출처
arXiv
논문 번호
995
분야
Computer Vision
arXiv 번호
2608.23486

이 논문은 자율주행 세계모델이 미래 영상 대신 미래 3차원 형상(포인트 클라우드)을 예측하게 하면 주행 계획이 훨씬 좋아진다는 것을 보였다.

이 논문은 한마디로 자율주행 세계모델의 예측 대상을 픽셀에서 3차원 기하로 바꾼 연구다. 픽셀은 조명·질감과 뒤섞여 3차원 운동을 간접적으로만 담지만, 포인트 클라우드는 구조와 운동을 직접 담는다. GeoWAM은 미래 장면 기하를 예측하도록 사전학습한 뒤, 그 표현에 액션 헤드를 붙여 자차 궤적을 예측한다. NAVSIM 닫힌루프 평가에서 비교 방법 중 최고 점수(EPDMS)를 기록했다.

핵심 요약

  • 미래 관측(픽셀) 대신 미래 장면 기하(포인트 맵)를 예측하는 세계모델 사전학습을 제안했다.
  • 다만 이 이점이 모든 구간에서 성립하지는 않아서, 1초 앞을 볼 때는 영상 기반 Epona+DVGT가 임계 정확도에서 더 높았다고 논문은 적는다.
  • 미래 기하 예측에서 평균 AbsRel 0.274→0.257, δ<1.25 0.655→0.754로 최강 기준선을 넘었다.
  • NAVSIM v2 닫힌루프 평가에서 비교 방법 중 최고 EPDMS를 달성했다.
  • 미래 영상을 따로 만들어 낼 필요가 없어서, 영상 생성 단계를 거치지 않고 예측한 기하 지식을 바로 주행 계획으로 넘긴다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)