UniVR: Thinking in Visual Space for Unified Visual Reasoning

발행일
출처
arXiv
논문 번호
629
분야
Computer Vision
arXiv 번호
2607.12800

순수 시각으로 복잡 추론/물리/계획 학습, VR-GRPO로 25% 향상.

VR-GRPO는 VLM evaluator의 global 평가와 error-prone substep을 타겟팅하는 step-focal reward를 결합하여 논리적 일관성과 물리적 타당성을 동시에 최적화한다. 16개 소스의 VR-X 벤치마크(long-horizon 조작, 공간 퍼즐, 물리 추론)를 구축해 평가했다. VR-X에서 최대 25% 향상, LP 60%/GR 70% 달성으로 34B 파라미터로 Gemini 3 Pro 파이프라인에 근접했다. 강화된 시각 추론이 MMMU +0.045, MathVista +2.3, MM-Vet +7.6 등 다중모달 이해 벤치마크까지 견인했다. Step-focal reward가 global-only 대비 reward hacking을 방지하며 long-term planning과 JEPA를 개선했다.

핵심 요약

  • VR-GRPO는 전체 결과 보상과 오류가 나기 쉬운 단계에 주는 보상을 함께 사용해 시각 추론의 논리와 물리 일관성을 학습한다.
  • 장기 조작, 공간 퍼즐, 물리 추론을 순수 시각 형식으로 묶은 16개 출처의 VR-X 벤치마크를 구축했다.
  • UniVR는 VR-X에서 최대 25% 향상됐고 강화된 시각 추론은 여러 멀티모달 이해 벤치마크의 성능도 높였다.
  • 코드, 데이터, 모델을 공개해 텍스트 설명 없이 시각 공간에서 계획하고 추론하는 연구에 활용할 수 있다.
  • 34B 모델과 긴 영상 학습에는 큰 계산 자원이 들고 단계 보상도 세밀한 물리 지식이 부족한 범용 VLM에 의존한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)