The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs
- 발행일
- 출처
- arXiv
- 논문 번호
- 602
- 분야
- Computer Vision
- arXiv 번호
- 2607.09544
VLM이 객체 개수 세기에 실패하는 원인이 내부 지식 부재가 아닌 출력과의 정렬 불일치임을 프로빙으로 입증하고, detector-guided 자기 교정으로 최대 15.6% 향상을 달성한다.
이 논문은 VLM의 카운팅 오류가 내부 표현에는 정답이 존재하지만 출력과 정렬되지 않아 발생함을 보인다. 4개 VLM의 중간 활성화에 프로브를 학습시킨 결과, 비선형 프로브가 카운팅 오류를 신뢰성 있게 감지했으며, SVCCA 분석으로 정답 프로브와 출력 프로브의 부분적으로 공유되지만 잘못 정렬된 부공간을 확인했다. 인과적 steering 개입으로 count 방향을 강화하면 성능이 향상됨을 검증했고, 이를 바탕으로 detector-guided self-correction(오류 예측 시 선택적 재프롬프트)을 제안해 파라미터 업데이트 없이 최대 15.6% 정확도 향상을 달성했다.
핵심 요약
- VLM 내부 활성화에 GT count·출력 count·오류 여부 3종 프로브 학습 — 오류를 신뢰성 있게 예측
- SVCCA: 정답 프로브와 출력 프로브가 부분 공유 부공간이지만 잘못 정렬된 방향으로 readout — 오류의 구조적 원인
- 인과적 steering: count 방향 강화 시 카운팅 성능 향상, 무작위 방향은 성능 저하 — 인과성 검증
- Detector-guided self-correction: 오류 예측 시에만 선택적 재프롬프트 — 최대 15.6% 절대 향상
- 무파라미터 업데이트: 추론 시점 개입만으로 개선 — 실용적 적용 가능
- 프로브 F1과 교정 gains의 강한 양의 상관(ρ=0.803) — 내부 오류 신호 품질이 교정 효과 결정
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.