Self-Supervised Visual On-Policy Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 916
- 분야
- Computer Vision
- arXiv 번호
- 2608.14144
정답표나 더 큰 교사 모델 없이, 학생에게 일부러 손상된 이미지를 보여 주는 차이만으로 시각 추론을 가르치는 방법이다.
이 논문은 한마디로 별도로 학습한 강한 교사 없이 학생 가중치의 이동 평균을 교사로 쓰는 자기지도 학습법 S2VOPD를 제안한다. 교사는 원본 이미지를 보고 학생은 해상도를 낮추고 잡음을 넣은 이미지를 본다. 학생이 만든 답에 대해 깨끗한 이미지를 본 교사의 출력 분포를 배우므로 정답, 관심 영역 표시와 외부 보상이 필요하지 않다. FineVision 질문 1만 2천 건으로 Qwen3.5 4B와 9B를 학습하자 세밀한 시각 인식과 수학 추론이 함께 좋아졌다. 다만 이미지를 너무 심하게 바꾸면 질문에 필요한 정보도 사라져 성능이 다시 낮아졌다.
핵심 요약
- 교사 모델은 깨끗한 이미지를 본다. 학생 모델은 같은 이미지의 손상된 버전을 보고 자기 답을 만든 뒤 교사의 출력 분포를 배운다.
- 가장 좋은 설정은 학생 이미지의 해상도를 원본의 0.3배에서 0.6배로 낮추고, 절반의 확률로 가우시안 잡음을 더하는 방식이었다.
- 학습에는 Qwen3.5 4B와 9B를 사용했다. 평가는 시각 인식 6종과 수학 추론 3종에서 진행했다.
- FineVision 질문 1만 2천 건으로 학습한 4B 모델의 시각 인식 6종 평균은 70.68퍼센트에서 77.44퍼센트로 6.76퍼센트포인트 올랐다.
- 같은 이미지를 교사와 학생에게 보여 준 실험은 평균 70.52퍼센트에 그쳤고 정보 차이를 준 전체 방법은 76.35퍼센트였다. 다만 일부 분석은 주요 평가보다 짧은 출력 제한을 사용했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.