WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving
- 발행일
- 출처
- arXiv
- 논문 번호
- 983
- 분야
- Computer Vision
- arXiv 번호
- 2608.20974
영상 자기지도학습 V-JEPA를 '미래 예측 + 행동 결합' 방식으로 개조해 자율주행 계획 벤치마크에서 최고 성적을 낸 세계-행동 모델 논문이다.
이 논문은 한마디로 영상 이해 모델 V-JEPA를 미래를 예측하고 행동까지 함께 만들도록 개조해 자율주행 계획을 잘 풀게 한 연구다. 원래 V-JEPA는 무작위로 가린 부분을 채우는 학습이라 '앞으로 어떻게 될까'를 예측하는 계획 과업과 맞지 않았다. 저자들은 미래 프레임을 가리고 맞추는 사전학습, 생성형 기법인 플로우 매칭으로 미래 표현 만들기, 장면과 자기 궤적을 함께 예측하는 결합 학습의 3단 개조를 했다. 그 결과 NAVSIM-v2에서 91.7 EPDMS로 최고 성적을 냈고, 별도 미세조정 없이 닫힌루프 HUGSIM에서도 1위를 했다.
핵심 요약
- 무작위 가림 복원을 미래 구간 가림 사전학습으로 바꿔 영상 표현 학습 목표를 자율주행 계획의 시간 방향과 맞췄다.
- 결정론적 회귀 대신 흐름 맞추기로 여러 가능한 미래 표현을 만들고, 장면과 차량 궤적을 하나의 예측기에서 함께 학습했다.
- NAVSIM-v2에서 91.7 EPDMS로 강한 종단간·세계행동 기준보다 1.6점과 1.3점 높았고, HUGSIM 폐쇄형 평가에서도 0.4462로 가장 높았다.
- 언어 추론을 거치지 않고 시각적 미래 예측이 행동 학습을 직접 돕는다는 점에서 자율주행 계획의 다른 설계 방향을 보여준다.
- 검증은 nuPlan 사전학습과 NAVSIM·HUGSIM 벤치마크에 집중돼 있어 실제 차량과 드문 위험 상황에서의 안전한 일반화는 추가 확인이 필요하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.