LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics

발행일
출처
arXiv
논문 번호
1029
분야
Computer Vision
arXiv 번호
2608.27395

타깃 인코더·프레딕터 같은 부속 장치 없이 단일 인코더로 학습하는 영상 사전학습 방법. V-JEPA 2 대비 최대 20.8배 적은 연산으로 같거나 더 좋은 성능을 낸다.

이 논문은 한마디로 영상 사전학습을 붕괴 방지용 잔가지 장치 없이 단일 인코더와 단일 손실로 할 수 있게 만든 LeVJEPA를 제안했다. 표현 붕괴(모든 입력이 같은 값으로 수렴하는 문제)를 막는 SIGReg 정규화가 수학적 보장을 주기 때문에 별도 장치가 필요 없다. 토큰 95%를 무작위로 버리는데 오히려 정확도가 올라가, 같은 데이터에서 V-JEPA 2 대비 5.6~20.8배 적은 연산으로 동등 이상 성능을 냈다. 프레임 단위 인과 어텐션(과거만 보고 현재를 계산)으로 학습해 스트리밍 추론에도 그대로 쓸 수 있다.

핵심 요약

  • EMA 타깃 인코더, 스톱그래디언트, 프레딕터 없이 단일 인코더만으로 영상 표현 학습을 해냈다.
  • 토큰 95%를 무작위로 버렸더니 ImageNet 정확도가 33.9%에서 47.6%로 오히려 올라갔다.
  • 동일 데이터·동일 에포크에서 V-JEPA 2 대비 총 사전학습 연산 5.6~20.8배를 절약하며 성능 동등 이상을 달성했다.
  • 같은 연산 예산에서는 최강 영상 베이스라인보다 ImageNet-1K에서 7.6점 앞섰다.
  • 블록-인과 어텐션으로 학습해 새 프레임이 오면 일정한 비용으로 표현을 확장할 수 있다(스트리밍·월드모델 친화적).

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)