Visual Contrastive Self-Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 705
- 분야
- Computer Vision
- arXiv 번호
- 2607.21556
이미지를 지운 것과 원본 이미지를 비교해서 시각적 의존도를 학습하는 자가 증류(자기 스스로 가르치는) 방법으로, 외부 교사 모델 없이도 VLM 성능을 높인다.
이 논은 한마디로 비전-언어 모델(VLM)이 이미지 없을 때와 있을 때의 차이를 스스로 비교해서 이미지를 더 잘 활용하도록 학습하는 '시각 대조 자가 증류(VCSD)' 방법이다. 기존 자가 증류는 외부 교사나 특권 정답이 필요했지만, 이 방법은 원본 이미지와 내용을 지운 이미지에 대한 EMA 교사(이동 평균 모델)의 예측을 비교하기만 하면 된다. 이미지에 의존하는 토큰의 확률을 높이는 방향으로 학습한다. Qwen3-VL 2B에서 62.27%→67.04%, 8B에서 72.51%→76.26%로 일관되게 향상되었다.
핵심 요약
- 원본 이미지와 내용을 지운 이미지 간 토큰 확률 차이를 비교해 시각 의존도를 학습한다.
- 외부 교사, 특권 정답, 시각 증거 신호, 추론 궤적이 전혀 필요 없다.
- 추론 시간이 추가로 들지 않는다 (학습 시에만 EMA 교사가 두 번 평가).
- Qwen3-VL 2B에서 +4.77%p, 4B에서 +1.86%p, 8B에서 +3.75%p 향상을 달성했다.
- 7개 비전-언어 벤치마크 평균에서 일관되게 기존 자가 증류 방식을 능가한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.