Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

발행일
출처
arXiv
논문 번호
710
분야
Computer Vision
arXiv 번호
2607.21072

이미지 생성 모델의 공간 지능을 텍스트 답변이 아닌 픽셀 단위 시각 답안으로 평가하는 프레임워크(ProVisE)와 진단 벤치마크(SpatialGen-Bench)다.

이 논문은 한마디로 이미지 생성 모델(GPT Image, FLUX 등)이 공간을 얼마나 잘 이해하는지, 텍스트로 답하는 기존 방식 대신 이미지 자체에 표시해서 답하도록 하는 평가 방법을 제안했다. ProVisE는 이미지 생성 모델이 시각적 형식(마킹, 하이라이트 등)으로 답하면 이를 파싱해서 기존 벤치마크와 동일한 기준으로 채점한다. SpatialGen-Bench는 14개 공간 소과제, 470개 샘플로 구성된 진단용 벤치마크다. 이미지 생성 모델은 시각적 표현이 직관적인 과제에서 경쟁력이 있었지만, 복합 추론이 필요한 과제에서는 텍스트 기반 VLM이 여전히 우세했다.

핵심 요약

  • 이미지 생성 모델이 픽셀 공간에서 직접 공간 답안을 표현하도록 하는 ProVisE 프레임워크를 제안했다.
  • 470개 샘플, 14개 소과제로 구성된 SpatialGen-Bench 진단 벤치마크를 구축했다.
  • 에이전트 빌더가 새로운 벤치마크에 맞는 평가 프로토콜을 자동 구성하고 검증한다.
  • 이미지 생성 모델은 직관적 시각 표현 과제에서 경쟁력이 있었다.
  • 실패의 88%는 시각 전달 채널 문제가 아닌, 공간 추론 자체의 오류였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)