Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 1001
- 분야
- Computer Vision
- arXiv 번호
- 2608.23329
이 논문은 영상 이해와 딥리서치를 한 에이전트로 합쳐, 영상 속 단서를 찾아 웹을 뒤져 답하는 '영상 딥리서치'를 8B 모델로 구현했다.
이 논문은 한마디로 영상판 딥리서치 에이전트다. VideoRover는 긴 영상에서 관련 구간을 잘라 확대하는 동시에, 이미지 검색·텍스트 검색·웹페이지 열람을 오가며 부족한 지식을 채운다. 검색 결과가 다시 영상 재확인을 유도하는 쌍방향 루프가 핵심이다. 26K 검증 SFT 트레젝토리와 3K RL 데이터로 훈련한 8B 모델이, 도구 없이 직접 답하는 GPT-5급 폐쇄 모델과 대등한 정확도(VideoDR 56%)를 냈다.
핵심 요약
- 영상 크롭(구간 확대)·이미지 검색·텍스트 검색·웹 열람을 하나의 탐색 루프로 통합했다.
- 뉴스나 시연, 다큐멘터리, 강의처럼 영상 속 단서를 영상 밖 지식과 이어야 하는 상황에서, 작은 모델도 모자란 지식을 검색으로 메워 답할 수 있게 된다.
- 26K 검증 SFT 트레젝토리 + 3K 강화학습 인스턴스를 뽑아내는 자동 데이터 파이프라인을 구축했다.
- VideoRover-8B-RL은 VideoDR 56.0%로 도구 없는 GPT-5(57.0%)와 대등했다.
- 다만 외부 검색 도구를 모두 빼면 VideoDR 정확도가 56.0%에서 13.0%로 무너져, 성능이 실시간 웹 검색에 크게 기대고 있음을 보여준다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.