Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

발행일
출처
arXiv
논문 번호
813
분야
Computer Vision
arXiv 번호
2608.03979

이 논문은 비디오 스트림에서 외부 웹 검색까지 하는 멀티모달 딥리서치 에이전트를 만들어 Claude-4.5-Sonnet을 5점 차로 앞섰다.

이 논문은 한마디로 비디오를 보면서 웹을 검색해 답을 찾는 에이전트를 만들었다. 기존 모델들은 비디오보다 텍스트 검색에 의존하거나, 외부 도구 없이 암기로 답하는 문제가 있었다. 이를 해결하기 위해 단계별 도구 잠금 해제로 시각적 증거를 먼저 충분히 모으게 하고, SFT+GRPO 2단계 학습으로 자율 탐색 능력을 길렀다. Video-DR-35B-A3B가 64.0%로 Claude-4.5-Sonnet(59.0%)을 뛰어넘었다.

핵심 요약

  • 비디오 프레임에서 핵심 장면을 골라내고 시각 검색을 수행하는 딥리서치 에이전트 파이프라인을 설계했다.
  • 모델이 텍스트 검색만 선호하는 모달리티 편향과 도구 없이 암기로 답하는 지식 누출 문제를 발견하고 해결했다.
  • SFT 후 GRPO(그룹 상대 정책 최적화)로 모방 학습 한계를 넘는 자율 탐색 능력을 길렀다.
  • 200개 복잡한 멀티홉 VQA로 구성된 VideoDR-Bench를 새로 구축했다.
  • 35B-A3B 모델이 64.0%로 Claude-4.5-Sonnet(59.0%)을 5점 차로 제치고 SOTA 달성.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)