Evidence-Backed Video Question Answering
- 발행일
- 출처
- arXiv
- 논문 번호
- 613
- 분야
- Computer Vision
- arXiv 번호
- 2607.11862
비디오 VQA에 밀집된 시공간 증거(추적된 segmentation masklets)를 추가로 출력하는 E-VQA 태스크 제안. ST-Evidence 벤치마크와 160k 규모의 튜닝 데이터셋 구축.
Evidence-Backed Video Question Answering(E-VQA)는 비디오 QA 모델이 의미론적 답변과 함께 시간 세그먼트 및 밀집 추적 segmentation masklets를 출력하도록 요구하는 새로운 태스크이다. ST-Evidence 벤치마크(인간 검증)와 160k 규모의 ST-Evidence-Instruct 데이터셋을 구축했으며, UniPixel 파인튜닝으로 t-mean +27.2, J&F +13.8 향상을 달성했다. 스케일링만으로는 QA 정확도와 시각적 grounding 간의 갭을 메울 수 없음을 입증했다.
핵심 요약
- E-VQA: 답변 + 시간 증거 + 공간 증거(masklets)의 3중 출력을 요구하는 새 태스크 정의
- ST-Evidence: 인간 검증된 최초의 시공간 grounding 벤치마크 (생성형/객관형 변체)
- Qwen3-VL, OpenAI-o3, Gemini-2.5-Pro 등 최첨단 모델에서 QA 정확도와 grounding 능력이 분리됨을 입증
- 160k 규모 ST-Evidence-Instruct 자동 생성 파이프라인으로 추론·grounding 갭 브릿지
- UniPixel 7B 파인튜닝 시 t-mean +27.2, J&F +13.8 대폭 향상
- 스케일링만으로는 해결 불가능; 아키텍처·데이터·훈련 목표의 근본적 발전 필요
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.