LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives

발행일
출처
arXiv
논문 번호
543
분야
Computer Vision
arXiv 번호
2607.00784

대비 학습 없이 end-to-end 비전-언어 사전학습을 수행하는 최초의 방법 LeVLJEPA를 제안한다. 밀집 semantic 특징 품질에서 대비 학습 기반(CLIP, SigLIP)을 능가한다.

LeVLJEPA는 negative pair, temperature, momentum encoder, teacher-student schedule 없이 cross-modal prediction과 분포 정규화만으로 비전-언어 사전학습을 수행하는 최초의 방법이다. CC12M(12M) 및 Datacomp-L(92M) 규모에서 훈련 후, zero-shot 분류에서는 CLIP/SigLIP과 경쟁력을 보이면서도, semantic segmentation 및 VLM 백본 등 밀집 특징이 필요한 downstream에서는 일관되게 대비 학습 기반을 능가한다. GQA, VQAv2, POPE 세 벤치마크에서 두 개의 서로 다른 언어모델 백론 모두에서 최고 성능을 기록했다.

핵심 요약

  • 비전-언어 사전학습에서 negative pair 없이 cross-modal prediction + SIGReg 정규화만으로 안정적 대규모 훈련 가능함을 최초로 입증
  • VLM 백본으로 사용 시 GQA 44.6%, VQAv2 54.2%, POPE 66.9%(Llama-1N 기준)로 CLIP/SigLIP 모두 능가
  • Semantic segmentation에서 대비 학습 기반 대비 우수한 dense semantic feature 품질 — patch-token 수준에서 구조화된 정보 보존
  • Zero-shot 분류에서는 대비 학습이 여전히 우위지만, 백본 활용에서는 zero-shot 성적이 오히려 역상관 관계
  • 전체 학습에 negative/temperature/momentum/teacher-student 불필요 → 학습 recipe의 단순화 및 비용 절감
  • 객체 중심 표현 학습에 유리하여 배경 robustness에서도 대비 기반 대비 우수

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)