OPD-V: Visual On-Policy Self-Distillation with Modality Balance

발행일
출처
arXiv
논문 번호
824
분야
Computer Vision
arXiv 번호
2608.05131

멀티모달 모델이 텍스트에 편향되지 않고 시각 정보를 균형 있게 쓰도록 만든 간단하면서 효과적인 학습 방법을 제안했다.

이 논문은 한마디로 멀티모달 AI가 텍스트에 너무 의존해서 이미지를 제대로 안 보는 문제(모달리티 불균형)를 해결한 연구다. 줌인한 이미지를 주는 '긍정 교사'와 이미지를 가린 '부정 교사'를 만들어 두 경우의 차이를 학습 신호로 활용한다. 이 차이가 큰 토큰만 선택적으로 증류해서 학습하므로 효율적이다. 4B 모델로 397B급 모델을 능가하는 성능을 내면서 학습 시간도 단축했다.

핵심 요약

  • 멀티모달 모델의 '텍스트 편향 현상(modality imbalance)'을 정량화하고 이를 특권 정보로 활용하는 새로운 패러다임을 제안했다.
  • 줌인 이미지(긍정 교사)와 마스크 이미지(부정 교사)의 로짓 차이로 '모달리티 균형 신뢰 영역'을 정의해 선택적 증류를 수행한다.
  • Qwen3.5-4B에서 평균 64.3%→80.0%로 15.7%p 향상하며 397B 모델(77.4%)까지 능가했다.
  • 응답 길이를 74.5% 단축시키면서 정확도는 올려 학습 단당 시간을 25~32% 단축했다.
  • 6개 벤치마크, 4개 백본, 5개 후처리 방법에서 일관된 향상을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)