OPD-V: Visual On-Policy Self-Distillation with Modality Balance
- 발행일
- 출처
- arXiv
- 논문 번호
- 824
- 분야
- Computer Vision
- arXiv 번호
- 2608.05131
멀티모달 모델이 텍스트에 편향되지 않고 시각 정보를 균형 있게 쓰도록 만든 간단하면서 효과적인 학습 방법을 제안했다.
이 논문은 한마디로 멀티모달 AI가 텍스트에 너무 의존해서 이미지를 제대로 안 보는 문제(모달리티 불균형)를 해결한 연구다. 줌인한 이미지를 주는 '긍정 교사'와 이미지를 가린 '부정 교사'를 만들어 두 경우의 차이를 학습 신호로 활용한다. 이 차이가 큰 토큰만 선택적으로 증류해서 학습하므로 효율적이다. 4B 모델로 397B급 모델을 능가하는 성능을 내면서 학습 시간도 단축했다.
핵심 요약
- 멀티모달 모델의 '텍스트 편향 현상(modality imbalance)'을 정량화하고 이를 특권 정보로 활용하는 새로운 패러다임을 제안했다.
- 줌인 이미지(긍정 교사)와 마스크 이미지(부정 교사)의 로짓 차이로 '모달리티 균형 신뢰 영역'을 정의해 선택적 증류를 수행한다.
- Qwen3.5-4B에서 평균 64.3%→80.0%로 15.7%p 향상하며 397B 모델(77.4%)까지 능가했다.
- 응답 길이를 74.5% 단축시키면서 정확도는 올려 학습 단당 시간을 25~32% 단축했다.
- 6개 벤치마크, 4개 백본, 5개 후처리 방법에서 일관된 향상을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.