OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

발행일
출처
arXiv
논문 번호
424
분야
Computer Vision
arXiv 번호
2606.14702

OmniVideo-100K는 구조화된 스크립트와 evidence chain을 통해 audio-visual 추론 능력을 향상시키는 대규모 instruction-tuning 데이터셋이다.

Entity-Anchored Video Scripting으로 영상을 구조화된 스크립트(요약, 엔티티 목록, 세그먼트별 audio-visual 설명)로 변환하고, Clue-Guided QA Generation으로 cross-segment·cross-modal 단서를 기반으로 QA pair를 생성한다. VITA-1.5 fine-tuning 시 OmniVideo-Test에서 최대 20.59% 향상을 달성했으며, Daily-Omni 등 기존 벤치마크에서도 최대 12.64% 일반화 개선을 보였다.

핵심 요약

  • Entity-Anchored Scripting: main entity list를 global prior로 사용하여 세그먼트 간 참조 일관성 확보, audio-visual 연관 복원
  • Clue-Guided QA Generation: LLM이 먼저 cross-segment multimodal clue를 mining한 후 해당 clue 기반으로 QA 생성
  • OmniVideo-100K: 100K 자동 생성 audio-visual QA pair + OmniVideo-Test (505개 human-verified sample), 10개 AV 과제 커버
  • Fine-tuning 효과: VITA-1.5 +20.59%, Qwen2.5-Omni-7B +17.82%, Qwen3-Omni-30B +13.86% (OmniVideo-Test 기준)

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)