AD-E2E-JEPA: A Joint-Embedding Predictive Architecture For End-to-End Autonomous Driving
- 발행일
- 출처
- arXiv
- 논문 번호
- 1137
- 분야
- Robotics
- arXiv 번호
- 2609.34085
AD-E2E-JEPA는 영상의 압축 표현으로 미래를 예측해 자율주행 경로 후보를 빠르게 비교하는 월드 모델이다.
기존 JEPA 기반 주행 모델은 경로를 정확히 비교하려면 계산 시간이 길어지는 문제가 있다. AD-E2E-JEPA는 학습 가능한 압축 모듈과 SIGReg 규제를 사용해 영상 특징의 크기를 줄인다. A100에서 256개 경로 후보를 평가하는 데 장면당 0.8초가 걸렸고 비교 모델들은 약 92초와 101초가 걸렸다. 사전 학습한 압축 모듈은 별도 모방학습에서도 EPDMS 점수를 80.2에서 85.4로 높였다. 다만 제로샷 평가는 실제 미래 영상을 목표로 주는 조건이며 목표 접근 자체가 도로 안전을 보장하지는 않는다.
핵심 요약
- AD-E2E-JEPA는 영상의 잠재 표현에서 미래를 예측하고 목표 영상에 가까운 경로를 선택하는 자율주행 월드 모델이다.
- SIGReg 규제를 적용한 학습 가능한 압축 모듈로 계획에 쓰는 패치 수를 16분의 1로 줄이고 특징 차원을 4분의 1로 줄인다.
- 256개 경로 후보를 평가하는 A100 실험에서 장면당 계획 시간은 0.8초로 DINO-WM과 JEPA-WM의 91.8초 및 101.0초보다 짧았다.
- 사전 학습한 압축 모듈을 별도 모방학습에 활용하면 EPDMS가 무작위 초기화의 80.2에서 85.4로 높아져 표현 재사용의 효과를 보였다.
- 제로샷 평가는 실제 미래 영상을 목표로 제공하고 안전을 직접 최적화하지 않으므로 결과를 실제 도로의 안전성 입증으로 해석할 수 없다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.