Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots
- 발행일
- 출처
- arXiv
- 논문 번호
- 869
- 분야
- Computer Vision
- arXiv 번호
- 2608.09931
이 논문은 외부 모델이나 주석 없이 멀티모달 LLM 스스로 자기 시각적 맹점을 찾아내고 밀도 있는 자기 증류를 수행하는 프레임워크(CVPD)를 제안했다. 12개 벤치마크에서 일관된 향상을 보였다.
이 논문은 한마디로 시각-언어 모델이 스스로 '내가 어떤 이미지 영역을 대충 보고 넘어갔는지'를 찾아내서, 그 부분을 확대한 뷰를 선생님으로, 해당 부분을 지운 뷰를 반면교사로 써서 자기 학습하는 방법을 제안했다. 핵심은 반사실 검증(zoom-in하면 답이 바뀌고, 지우면 답이 안 바뀌는 영역 = 맹점)이다. Qwen3-VL-8B에서 외부 GPT-4o 감독을 쓰는 방법들보다 더 높은 성능 향상을 달성했다.
핵심 요약
- 외부 모델, 주석, 도구 없이 모델 자체의 반사실 응답만으로 시각적 맹점을 찾아내는 3단계 검증 기준을 제안했다.
- 맹점 영역을 확대한 뷰(긍정 교사)와 제거한 뷰(부정 교사)로 대비 증류를 수행했다.
- Qwen3-VL-8B에서 12개 벤치마크 모두 향상, 단일 회귀도 없음을 확인했다.
- OCRBench +3.60, MMStar 세밀 지각 +3.38, 논리 추론 +3.08 향상을 기록했다.
- 외부 GPT-4o 감독에 의존하는 6개 자기진화 베이스라인을 모두 능가했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.