VISReg: Variance-Invariance-Sketching Regularization for JEPA training

발행일
출처
arXiv
논문 번호
291
분야
Computer Vision
arXiv 번호
2606.02572

자기지도 학습 방법은 모델링 휴리스틱이나 임베딩 공간의 명시적 정규화를 통해 임베딩 붕괴를 방지한다.

VISReg는 자기지도 학습에서 임베딩 붕괴를 막으면서 표현의 전체 분포 형태를 안정적으로 제어하기 위한 정규화 방법이다. VICReg의 공분산 항을 슬라이스드 바서슈타인 기반 스케칭 목표로 바꾸고 분산 항은 유지해, 표현의 크기와 분포 형태를 따로 조절한다. 이 설계는 붕괴 상태에서도 유효한 기울기를 제공하며 계산량이 데이터 규모에 선형으로 증가하도록 구성됐다. 저품질·롱테일·저랭크 데이터 조건에서 기존 정규화보다 견고했고, ImageNet-1K 사전학습 모델은 분포 밖 데이터에서 강한 성능을 보였다. 다만 밀집 예측에서는 최상위 방법과 격차가 남았으며, ImageNet-22K로 학습한 모델이 10배 많은 데이터를 쓴 DINOv2의 분포 밖 성능과 비슷했다는 결과는 데이터 효율 가능성을 보여주는 비교로 해석해야 한다.

핵심 요약

  • SIGReg와 같은 스케칭 기반 방법은 임베딩을 등방성 가우시안에 정렬하여 이를 해결하지만, 유연성이 부족하고 붕괴 상황에서 기울기 소실 문제를 겪는다.
  • VISReg는 선형적으로 확장되며, 저품질 데이터셋에서 기존 정규화 기법을 능가하고, 롱테일 및 저랭크 환경에서 견고함을 보인다.
  • ImageNet-1K로 사전학습된 VISReg는 분포 외 데이터셋에서 SOTA 성능을 달성한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)