VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 1020
- 분야
- Computer Vision
- arXiv 번호
- 2608.26105
'생성이 곧 추론'이라는 네이티브 시각 추론을 300개 과제와 검증 가능한 보상으로 훈련·평가·RL까지 원스톱 만든 테스트베드 논문.
이 논문은 한마디로 이미지·비디오 생성으로 문제를 푸는 '네이티브 시각 추론'을 위한 훈련·평가 인프라다. 절차적으로 생성되는 300개 과제와 사람 판정에 맞춘 검증 가능한 보상 스코어를 제공한다. 이 과제로 훈련한 모델은 못 본 외부 벤치마크 7곳에서 자주 20%p 이상 향상됐고, 그 보상으로 RL을 돌리니 생성 품질도 올라갔다. 분석 결과, 언어로 된 사고과정보다 시각 상태를 직접 조작하는 궤적이 추론의 핵심 기반이었다.
핵심 요약
- VLM-as-a-judge 평가가 숫자 세기 오류·미세 근거 무시·규칙 오독 같은 실패를 반복함을 확인하고, 결정적 규칙 기반 스코어로 대체했다.
- 300개 절차 생성 과제로 훈련한 모델이 RISE-Video, MME-CoF-Pro 등 외부 벤치마크 7곳에서 대폭 전이됐다(자주 +20%p 이상).
- 이득이 지시 패턴 암기가 아니라 진짜 시각 추론 때문인지 최근접 이웃·반사실 진단 실험으로 검증했다.
- 이미지·비디오·인터리브 생성기 30여 개를 같은 과제 분포로 비교해, 시공간 상태 추적엔 비디오가, 계산 효율엔 인터리브가 유리함을 밝혔다.
- 검증 보상으로 RL을 돌리자 미로 탐색 점수가 0.2249에서 0.8692로 뛰고, 중간 답을 스스로 고치는 자기수정도 관찰됐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.