AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research
- 발행일
- 출처
- arXiv
- 논문 번호
- 1026
- 분야
- Computer Vision
- arXiv 번호
- 2608.25559
영상 딥리서치 에이전트가 '필요한 도구만, 필요할 때만' 쓰고 불안한 중간 결과만 되돌아가게 만든 논문. 도구 호출을 줄이면서 정확도는 유지·향상.
이 논문은 한마디로 영상 기반 심층 질의응답 에이전트가 도구를 낭비 없이 쓰게 만든다. 질문·영상 유형마다 필요한 도구(시간·공간 그라운딩, 이미지·웹 검색)가 다른데, 기존엔 정해진 워크플로우를 다 돌려 비용과 오류가 쌓였다. AdaVDR은 모델이 스스로 할 수 있는 일은 도구를 건너뛰고, 중간 결과가 불안할 때만 되돌아가서 다시 확인한다. 학습 데이터도 '모델이 직접 답할 수 있는 도구 호출은 제거'하는 필터로 정제했고, SFT 후 중복 페널티 RL로 다듬었다. 결과적으로 도구 호출 수를 줄이면서 정확도를 유지·향상했다.
핵심 요약
- 질문·영상 유형별로 최적 도구 조합이 다름을 문제 삼고, 모델이 자기 능력과 내부 지식을 보고 도구 호출을 건너뛰게 했다.
- 대상 모델이 도구 없이도 답할 수 있는 호출을 학습 궤적에서 제거하는 '모델 조건부 도구 필요성 필터링'을 제안했다.
- 엔티티·이벤트 중심 질문 250개, 7개 도메인을 아우르는 VDR-EE 벤치마크와 학습 데이터를 구축해 공개했다.
- 평가한 오픈소스 모델 중 최고 성능을 냈고, VideoDR에서도 베이스 대비 큰 향상을 보였다.
- 중복 인지 보상 RL로 정확도(51%)를 유지한 채 평균 도구 호출을 7.84번에서 6.80번으로 줄였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.