Gaze Heads: How VLMs Look at What They Describe

발행일
출처
arXiv
논문 번호
427
분야
Computer Vision
arXiv 번호
2606.14703

VLM 내부에서 현재 설명 중인 이미지 영역을 추적하는 'gaze head'라는 소수의 attention head를 발견하고, 이를 제어해 모델의 시각적 주의를 steering하는 연구다.

Qwen3-VL-8B의 1,152개 head 중 약 100개(8.7%)만이 현재 묘사 중인 이미지 영역을 추적하며, 이들에 단일 attention-mask 개입을 가하면 83.1% 정확도로 모델의 답변을 원하는 영역으로 redirect할 수 있다. 이 메커니즘은 2B~32B까지 모델 크기와 여러 VLM 아키텍처에 걸쳐 반복되지만, frozen-encoder 계열(LLaVA, Bunny)에서는 나타나지 않아 vision encoder 공동 학습이 조건임을 시사한다. COCO 자연 이미지에서도 작동하며, retraining 없이 inference-time 제어가 가능함을 입증했다.

핵심 요약

  • VLM의 1,152개 attention head 중 약 100개(8.7%)가 현재 설명 중인 이미지 영역을 추적하는 'gaze head' 역할 수행
  • 단일 attention-mask 개입으로 comic panel redirect 83.1% 정확도 달성 (random head에서는 실패)
  • 2B~32B 파라미터 및 Qwen2-VL, Ovis1.5, InternVL3.5 등 다양한 VLM에서 동일 메커니즘 확인
  • Frozen-encoder 계열(LLaVA, Bunny-3B)에서는 gaze head 부재 → vision encoder 공동 학습 필요성 시사

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)