OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains
- Published
- Source
- arXiv
- Paper number
- 424
- Field
- Computer Vision
- arXiv ID
- 2606.14702
Key points
- Entity-Anchored Scripting uses the main entity list as a global prior to keep references consistent across segments and recover audio-visual associations.
- Clue-Guided QA Generation first mines cross-segment multimodal clues and then generates QA pairs from those clues.
- OmniVideo-100K contains 100K automatically generated audio-visual QA pairs and OmniVideo-Test with 505 human-verified samples, covering 10 AV tasks.
- Fine-tuning gains are +20.59% for VITA-1.5, +17.82% for Qwen2.5-Omni-7B, and +13.86% for Qwen3-Omni-30B on OmniVideo-Test.
Paper links
External research summaries. These are not HDATF publications or measured product results.