AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

발행일
출처
arXiv
논문 번호
1026
분야
Computer Vision
arXiv 번호
2608.25559

영상 딥리서치 에이전트가 '필요한 도구만, 필요할 때만' 쓰고 불안한 중간 결과만 되돌아가게 만든 논문. 도구 호출을 줄이면서 정확도는 유지·향상.

이 논문은 한마디로 영상 기반 심층 질의응답 에이전트가 도구를 낭비 없이 쓰게 만든다. 질문·영상 유형마다 필요한 도구(시간·공간 그라운딩, 이미지·웹 검색)가 다른데, 기존엔 정해진 워크플로우를 다 돌려 비용과 오류가 쌓였다. AdaVDR은 모델이 스스로 할 수 있는 일은 도구를 건너뛰고, 중간 결과가 불안할 때만 되돌아가서 다시 확인한다. 학습 데이터도 '모델이 직접 답할 수 있는 도구 호출은 제거'하는 필터로 정제했고, SFT 후 중복 페널티 RL로 다듬었다. 결과적으로 도구 호출 수를 줄이면서 정확도를 유지·향상했다.

핵심 요약

  • 질문·영상 유형별로 최적 도구 조합이 다름을 문제 삼고, 모델이 자기 능력과 내부 지식을 보고 도구 호출을 건너뛰게 했다.
  • 대상 모델이 도구 없이도 답할 수 있는 호출을 학습 궤적에서 제거하는 '모델 조건부 도구 필요성 필터링'을 제안했다.
  • 엔티티·이벤트 중심 질문 250개, 7개 도메인을 아우르는 VDR-EE 벤치마크와 학습 데이터를 구축해 공개했다.
  • 평가한 오픈소스 모델 중 최고 성능을 냈고, VideoDR에서도 베이스 대비 큰 향상을 보였다.
  • 중복 인지 보상 RL로 정확도(51%)를 유지한 채 평균 도구 호출을 7.84번에서 6.80번으로 줄였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)