OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

Published
Source
arXiv
Paper number
424
Field
Computer Vision
arXiv ID
2606.14702

Key points

  • Entity-Anchored Scripting uses the main entity list as a global prior to keep references consistent across segments and recover audio-visual associations.
  • Clue-Guided QA Generation first mines cross-segment multimodal clues and then generates QA pairs from those clues.
  • OmniVideo-100K contains 100K automatically generated audio-visual QA pairs and OmniVideo-Test with 505 human-verified samples, covering 10 AV tasks.
  • Fine-tuning gains are +20.59% for VITA-1.5, +17.82% for Qwen2.5-Omni-7B, and +13.86% for Qwen3-Omni-30B on OmniVideo-Test.

Paper links

External research summaries. These are not HDATF publications or measured product results.

Read original (opens in a new tab)