Gaze Heads: How VLMs Look at What They Describe
- 발행일
- 출처
- arXiv
- 논문 번호
- 427
- 분야
- Computer Vision
- arXiv 번호
- 2606.14703
VLM 내부에서 현재 설명 중인 이미지 영역을 추적하는 'gaze head'라는 소수의 attention head를 발견하고, 이를 제어해 모델의 시각적 주의를 steering하는 연구다.
Qwen3-VL-8B의 1,152개 head 중 약 100개(8.7%)만이 현재 묘사 중인 이미지 영역을 추적하며, 이들에 단일 attention-mask 개입을 가하면 83.1% 정확도로 모델의 답변을 원하는 영역으로 redirect할 수 있다. 이 메커니즘은 2B~32B까지 모델 크기와 여러 VLM 아키텍처에 걸쳐 반복되지만, frozen-encoder 계열(LLaVA, Bunny)에서는 나타나지 않아 vision encoder 공동 학습이 조건임을 시사한다. COCO 자연 이미지에서도 작동하며, retraining 없이 inference-time 제어가 가능함을 입증했다.
핵심 요약
- VLM의 1,152개 attention head 중 약 100개(8.7%)가 현재 설명 중인 이미지 영역을 추적하는 'gaze head' 역할 수행
- 단일 attention-mask 개입으로 comic panel redirect 83.1% 정확도 달성 (random head에서는 실패)
- 2B~32B 파라미터 및 Qwen2-VL, Ovis1.5, InternVL3.5 등 다양한 VLM에서 동일 메커니즘 확인
- Frozen-encoder 계열(LLaVA, Bunny-3B)에서는 gaze head 부재 → vision encoder 공동 학습 필요성 시사
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.