Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

발행일
출처
arXiv
논문 번호
198
분야
Computer Vision
arXiv 번호
2605.18740

Vision-OPD 프레임워크는 온-폴리시 자기 증류를 활용해 모델이 자신의 특권적 영역 인지로부터 학습하게 함으로써, 멀티모달 대규모 언어 모델이 세밀한 시각적 디테일을 식별하는 능력을 향상시킨다.

멀티모달 언어 모델은 작은 영역만 잘라 보여주면 맞히는 세부 질문도 전체 이미지에서는 관련 증거에 집중하지 못해 틀리는 경우가 많다. Vision-OPD는 같은 모델을 확대 영역을 보는 교사와 전체 이미지를 보는 학생으로 나눠 이 영역 대 전체 인식 차이를 줄인다. 학생이 현재 정책으로 생성한 답의 각 토큰에서 교사와 학생의 다음 토큰 분포 차이를 줄이는 온-폴리시 자기 증류를 사용한다. 외부 교사 모델, 정답 라벨, 보상 검증기, 추론 시점 도구 없이도 확대 관찰의 이점을 전체 이미지 정책에 옮긴다. 여러 세밀 시각 이해 벤치마크에서 훨씬 큰 공개 및 비공개 모델과 이미지 도구를 쓰는 에이전트에 견줄 만하거나 더 좋은 성능을 보였다.

핵심 요약

  • 질문 생성: 각 작은 영역에 대해 MLLM은 해당 영역 내부의 디테일을 봐야만 답할 수 있는 질문 q를 생성한다.
  • 전체 이미지로의 그라운딩: 영역의 바운딩 박스를 전체 이미지 I 위에 겹쳐 학생 입력 x를 만든다. 학생이 어디에 집중해야 하는지 알 수 있도록 질문에 공간적 지시문(예: "빨간 박스를 보라")을 추가한다.
  • 크롭 생성: 해당 영역을 잘라내어 크기를 조정(흔히 2배)해 교사 입력 x'를 만든다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)