UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

발행일
출처
arXiv
논문 번호
856
분야
Computer Vision
arXiv 번호
2608.07409

이미지와 비디오에서 세계 모델을 따로 따로 학습하던 JEPA를 하나로 합쳐, 단 하나의 손실 하이퍼파라미터로 통합 학습하는 프레임워크다.

이 논문은 한마디로 이미지와 비디오 모두에서 작동하는 통합 세계 모델(UniJEPA)을 하나의 잠재 공간에서 end-to-end로 학습하는 방법을 제안한다. 기존 JEPA 계열(I-JEPA, V-JEPA 2, DINO-WM 등)은 이미지 변환 예측과 비디오 시간 예측을 각각 다른 모델로 따로 학습했다. UniJEPA는 이 둘을 하나의 손실 함수로 묶어서, EMA나 stop-gradient 같은 트릭 없이도 표현 붕괴를 막는다(수학적 증명 포함). 이미지 분류, 비디오 이해, 제어 과제에서 개별 JEPA와 동급이거나 더 좋았고, 생성형 세계 모델보다 최대 수십 배 빠르게 계획을 세울 수 있다.

핵심 요약

  • 이미지 수준 변환 예측과 비디오 수준 시간 예측을 하나의 잠재 공간에서 통합 학습하는 단일 목적 함수를 제안했다.
  • EMA, stop-gradient, 사전 학습된 인코더 없이 end-to-end 학습이 가능하며, Gaussian 정규화로 표현 붕괴를 수학적으로 방지한다.
  • 광도 예측은 불변 구조를, 시간 예측은 등변 동역학을 학습하며, 둘 사이의 비중을 조절해 추상화 수준을 제어할 수 있다.
  • ImageNet, Something-Something-v2, Epic-Kitchens, 제어 벤치마크에서 개별 JEPA 대비 동급 이상의 성능을 달성했다.
  • 액션 조건부 후학습 후 제로샷 계획이 가능하며, 생성형 세계 모델 대비 최대 수십 배 빠른 속도로 계획을 수립한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)