VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

발행일
출처
arXiv
논문 번호
1020
분야
Computer Vision
arXiv 번호
2608.26105

'생성이 곧 추론'이라는 네이티브 시각 추론을 300개 과제와 검증 가능한 보상으로 훈련·평가·RL까지 원스톱 만든 테스트베드 논문.

이 논문은 한마디로 이미지·비디오 생성으로 문제를 푸는 '네이티브 시각 추론'을 위한 훈련·평가 인프라다. 절차적으로 생성되는 300개 과제와 사람 판정에 맞춘 검증 가능한 보상 스코어를 제공한다. 이 과제로 훈련한 모델은 못 본 외부 벤치마크 7곳에서 자주 20%p 이상 향상됐고, 그 보상으로 RL을 돌리니 생성 품질도 올라갔다. 분석 결과, 언어로 된 사고과정보다 시각 상태를 직접 조작하는 궤적이 추론의 핵심 기반이었다.

핵심 요약

  • VLM-as-a-judge 평가가 숫자 세기 오류·미세 근거 무시·규칙 오독 같은 실패를 반복함을 확인하고, 결정적 규칙 기반 스코어로 대체했다.
  • 300개 절차 생성 과제로 훈련한 모델이 RISE-Video, MME-CoF-Pro 등 외부 벤치마크 7곳에서 대폭 전이됐다(자주 +20%p 이상).
  • 이득이 지시 패턴 암기가 아니라 진짜 시각 추론 때문인지 최근접 이웃·반사실 진단 실험으로 검증했다.
  • 이미지·비디오·인터리브 생성기 30여 개를 같은 과제 분포로 비교해, 시공간 상태 추적엔 비디오가, 계산 효율엔 인터리브가 유리함을 밝혔다.
  • 검증 보상으로 RL을 돌리자 미로 탐색 점수가 0.2249에서 0.8692로 뛰고, 중간 답을 스스로 고치는 자기수정도 관찰됐다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)