Evidence-Backed Video Question Answering

발행일
출처
arXiv
논문 번호
613
분야
Computer Vision
arXiv 번호
2607.11862

비디오 VQA에 밀집된 시공간 증거(추적된 segmentation masklets)를 추가로 출력하는 E-VQA 태스크 제안. ST-Evidence 벤치마크와 160k 규모의 튜닝 데이터셋 구축.

Evidence-Backed Video Question Answering(E-VQA)는 비디오 QA 모델이 의미론적 답변과 함께 시간 세그먼트 및 밀집 추적 segmentation masklets를 출력하도록 요구하는 새로운 태스크이다. ST-Evidence 벤치마크(인간 검증)와 160k 규모의 ST-Evidence-Instruct 데이터셋을 구축했으며, UniPixel 파인튜닝으로 t-mean +27.2, J&F +13.8 향상을 달성했다. 스케일링만으로는 QA 정확도와 시각적 grounding 간의 갭을 메울 수 없음을 입증했다.

핵심 요약

  • E-VQA: 답변 + 시간 증거 + 공간 증거(masklets)의 3중 출력을 요구하는 새 태스크 정의
  • ST-Evidence: 인간 검증된 최초의 시공간 grounding 벤치마크 (생성형/객관형 변체)
  • Qwen3-VL, OpenAI-o3, Gemini-2.5-Pro 등 최첨단 모델에서 QA 정확도와 grounding 능력이 분리됨을 입증
  • 160k 규모 ST-Evidence-Instruct 자동 생성 파이프라인으로 추론·grounding 갭 브릿지
  • UniPixel 7B 파인튜닝 시 t-mean +27.2, J&F +13.8 대폭 향상
  • 스케일링만으로는 해결 불가능; 아키텍처·데이터·훈련 목표의 근본적 발전 필요

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)