Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning

발행일
출처
arXiv
논문 번호
402
분야
Computer Vision
arXiv 번호
2606.11683

에고센트릭 비디오의 공간 추론을 2단계(가설 형성, 교차 시점 검증)로 개선하는 training-free 프레임워크. VGGT로 합성한 신규 시점에서 초기 가설을 수정한다.

ReRe(Reason, then Re-reason)는 에고센트릭 비디오의 공간 추론을 재방문 가능한(revisitable) 과정으로 정형화한다. 1단계 Reason Phase에서 원본 비디오로 공간 가설을 형성하고, 2단계 Re-reason Phase에서 VGGT로 합성한 새로운 시점 고도 영상으로 가설을 검증하고 수정한다. 최고점 사선 뷰를 합성하는 Geometry-to-Video 파이프라인이 핵심이며, VSI-Bench에서 5.2점 향상, STI-Bench에서 유의미한 향상을 달성했다. 수정된 답안 중 71.6%가 정답으로 전환되는 등 높은 정정 품질을 보인다.

핵심 요약

  • 공간 추론을 단일 턴이 아닌 가설-검증의 2단계 과정으로 재정의
  • VGGT 단안 3D 복원으로 전략적으로 보완적인 고도 사선 시점(Oblique Sweep) 합성
  • MLLM 아키텍처 수정 없이 추론 시간에 적용 가능한 training-free 프레임워크
  • VSI-Bench 평균 5.2점 향상; 샘플 레벨에서 positive flip 71.6% vs negative flip 28.4% (2.52:1 비율)
  • A100 GPU에서 샘플당 약 11초; VGGT 입력을 20프레임으로 줄이면 약 4초에 2.8점 향상 유지
  • Birds-eye보다 Oblique Sweep이 우수 - 시점 분포 mismatch 방지하면서 공간 정보 노출

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)