Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- 발행일
- 출처
- arXiv
- 논문 번호
- 710
- 분야
- Computer Vision
- arXiv 번호
- 2607.21072
이미지 생성 모델의 공간 지능을 텍스트 답변이 아닌 픽셀 단위 시각 답안으로 평가하는 프레임워크(ProVisE)와 진단 벤치마크(SpatialGen-Bench)다.
이 논문은 한마디로 이미지 생성 모델(GPT Image, FLUX 등)이 공간을 얼마나 잘 이해하는지, 텍스트로 답하는 기존 방식 대신 이미지 자체에 표시해서 답하도록 하는 평가 방법을 제안했다. ProVisE는 이미지 생성 모델이 시각적 형식(마킹, 하이라이트 등)으로 답하면 이를 파싱해서 기존 벤치마크와 동일한 기준으로 채점한다. SpatialGen-Bench는 14개 공간 소과제, 470개 샘플로 구성된 진단용 벤치마크다. 이미지 생성 모델은 시각적 표현이 직관적인 과제에서 경쟁력이 있었지만, 복합 추론이 필요한 과제에서는 텍스트 기반 VLM이 여전히 우세했다.
핵심 요약
- 이미지 생성 모델이 픽셀 공간에서 직접 공간 답안을 표현하도록 하는 ProVisE 프레임워크를 제안했다.
- 470개 샘플, 14개 소과제로 구성된 SpatialGen-Bench 진단 벤치마크를 구축했다.
- 에이전트 빌더가 새로운 벤치마크에 맞는 평가 프로토콜을 자동 구성하고 검증한다.
- 이미지 생성 모델은 직관적 시각 표현 과제에서 경쟁력이 있었다.
- 실패의 88%는 시각 전달 채널 문제가 아닌, 공간 추론 자체의 오류였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.