VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

발행일
출처
arXiv
논문 번호
295
분야
Computer Vision
arXiv 번호
2606.02564

최근의 '비디오를 통한 추론' 패러다임은 비디오 생성 모델(VGM)을 활용하여 추론 작업을 완수하기 위한 시간적으로 일관된 시각 궤적을 생성한다.

이 연구는 비디오 생성 모델이 시각 품질은 높지만 과제별 규칙을 따르지 못해 추론 과정에서 논리적 오류를 내는 문제를 다룬다. 기존처럼 비전-언어 모델을 텍스트 풀이자로 쓰는 대신, 과정 제약과 최종 목표를 평가하는 테스트 시점 교사로 사용한다. 교사가 과제별 규칙으로 미분 가능한 보상을 만들면 비디오 생성 모델은 가벼운 LoRA 모듈을 온라인으로 최적화해 현재 문제에 적응한다. VBVR-Bench와 RULER-Bench 평가에서 이 방식은 기준 추론 모델보다 평균 16.7점 높았고, 비슷한 계산 비용의 텍스트 풀이 및 Best-of-N 방식보다 큰 개선을 보였다. 이는 고수준 규칙을 텍스트 지시로만 전달하기보다 생성 과정을 직접 감독하는 방식이 일반화 가능한 비디오 추론에 더 효과적일 수 있음을 보여준다.

핵심 요약

  • 최첨단 VGM은 시각적 품질이 뛰어나지만, 작업별 규칙을 이해하고 따르는 데 종종 어려움을 겪어 다양한 추론 시나리오에서 논리적 실패로 이어진다.
  • VLM은 풀이자로서는 어려움을 겪지만, 과정 제약 조건의 충족과 최종 목표 달성을 평가할 수 있는 강력한 인식 능력을 갖추고 있다.
  • 이러한 결과는 VLM을 테스트 시점 교사로 통합하는 것이 일반화 가능한 비디오 추론을 달성하기 위한 유망한 패러다임을 제공함을 보여준다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)