Visual Contrastive Self-Distillation

발행일
출처
arXiv
논문 번호
705
분야
Computer Vision
arXiv 번호
2607.21556

이미지를 지운 것과 원본 이미지를 비교해서 시각적 의존도를 학습하는 자가 증류(자기 스스로 가르치는) 방법으로, 외부 교사 모델 없이도 VLM 성능을 높인다.

이 논은 한마디로 비전-언어 모델(VLM)이 이미지 없을 때와 있을 때의 차이를 스스로 비교해서 이미지를 더 잘 활용하도록 학습하는 '시각 대조 자가 증류(VCSD)' 방법이다. 기존 자가 증류는 외부 교사나 특권 정답이 필요했지만, 이 방법은 원본 이미지와 내용을 지운 이미지에 대한 EMA 교사(이동 평균 모델)의 예측을 비교하기만 하면 된다. 이미지에 의존하는 토큰의 확률을 높이는 방향으로 학습한다. Qwen3-VL 2B에서 62.27%→67.04%, 8B에서 72.51%→76.26%로 일관되게 향상되었다.

핵심 요약

  • 원본 이미지와 내용을 지운 이미지 간 토큰 확률 차이를 비교해 시각 의존도를 학습한다.
  • 외부 교사, 특권 정답, 시각 증거 신호, 추론 궤적이 전혀 필요 없다.
  • 추론 시간이 추가로 들지 않는다 (학습 시에만 EMA 교사가 두 번 평가).
  • Qwen3-VL 2B에서 +4.77%p, 4B에서 +1.86%p, 8B에서 +3.75%p 향상을 달성했다.
  • 7개 비전-언어 벤치마크 평균에서 일관되게 기존 자가 증류 방식을 능가한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)