LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives
- 발행일
- 출처
- arXiv
- 논문 번호
- 543
- 분야
- Computer Vision
- arXiv 번호
- 2607.00784
대비 학습 없이 end-to-end 비전-언어 사전학습을 수행하는 최초의 방법 LeVLJEPA를 제안한다. 밀집 semantic 특징 품질에서 대비 학습 기반(CLIP, SigLIP)을 능가한다.
LeVLJEPA는 negative pair, temperature, momentum encoder, teacher-student schedule 없이 cross-modal prediction과 분포 정규화만으로 비전-언어 사전학습을 수행하는 최초의 방법이다. CC12M(12M) 및 Datacomp-L(92M) 규모에서 훈련 후, zero-shot 분류에서는 CLIP/SigLIP과 경쟁력을 보이면서도, semantic segmentation 및 VLM 백본 등 밀집 특징이 필요한 downstream에서는 일관되게 대비 학습 기반을 능가한다. GQA, VQAv2, POPE 세 벤치마크에서 두 개의 서로 다른 언어모델 백론 모두에서 최고 성능을 기록했다.
핵심 요약
- 비전-언어 사전학습에서 negative pair 없이 cross-modal prediction + SIGReg 정규화만으로 안정적 대규모 훈련 가능함을 최초로 입증
- VLM 백본으로 사용 시 GQA 44.6%, VQAv2 54.2%, POPE 66.9%(Llama-1N 기준)로 CLIP/SigLIP 모두 능가
- Semantic segmentation에서 대비 학습 기반 대비 우수한 dense semantic feature 품질 — patch-token 수준에서 구조화된 정보 보존
- Zero-shot 분류에서는 대비 학습이 여전히 우위지만, 백본 활용에서는 zero-shot 성적이 오히려 역상관 관계
- 전체 학습에 negative/temperature/momentum/teacher-student 불필요 → 학습 recipe의 단순화 및 비용 절감
- 객체 중심 표현 학습에 유리하여 배경 robustness에서도 대비 기반 대비 우수
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.