Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs

발행일
출처
arXiv
논문 번호
072
분야
Vision / Reasoning
arXiv 번호
2506.22146

Sharif University of Technology 연구진은 입력 이미지에 구조화된 수평선과 순차 스캔 프롬프트를 추가하여 대규모 비전-언어 모델의 시각 추론을 향상시키는 방법 VISER를 개발했다.

Sharif University of Technology 연구진은 입력 이미지에 구조화된 수평선과 순차 스캔 프롬프트를 추가하여 대규모 비전-언어 모델의 시각 추론을 향상시키는 방법 VISER를 개발했다. 이 접근법은 GPT-4o의 2D 장면 계수 정확도를 최대 26.83% 향상시켰으며, 시각 탐색, 장면 묘사, 공간 추론 과제 전반에서 오류를 일관되게 줄였다.

핵심 요약

  • 대규모 비전-언어 모델(LVLM)은 정확한 계수, 공간 추론, 상세한 장면 묘사 같은 정밀한 시각 이해에 어려움을 겪는다.
  • LVLM은 결합 문제를 겪어, 복잡한 장면 내에서 지각 특징을 올바른 시각적 대상과 공간 속성에 안정적으로 연결하지 못한다.
  • 기존 LVLM은 흔히 시각 특징을 병렬로 처리하여, 특히 어수선한 환경에서 간섭과 오귀속 오류를 일으킨다.
  • VISER 방법은 입력 이미지에 등간격 수평선을 추가하여, 이미지를 별개의 시각 구획 또는 행으로 분할한다.
  • '이미지에 존재하는 수평선을 기준으로 이미지를 순차적으로 스캔하라'와 같은 간결한 텍스트 지시를 원본 프롬프트 앞에 덧붙여, LVLM이 영역별로 내용을 처리하도록 유도한다.
  • 이 경량의 모델 비종속적 접근법은 무시할 만한 연산 오버헤드만 도입하며, 아키텍처 변경, 미세조정, 다중 질의 추론을 필요로 하지 않는다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)