How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

발행일
출처
arXiv
논문 번호
266
분야
Computer Vision
arXiv 번호
2605.27310

통합 멀티모달 모델(UMM)에서 교차 시점 공간 추론을 위해 시각적 사고(visual thinking)가 실제로 작동하게 만드는 View Dropout(VDrop) 훈련 기법과 최적의 시각적 표현 유형을 분석한다.

본 연구는 통합 멀티모달 모델에서 교차 시점 공간 추론을 할 때 생성되는 thinking-image가 실제로 활용되도록 만드는 View Dropout(VDrop) 훈련 기법을 제안한다. VDrop은 답변 구간에서 한 입력 뷰의 일부를 가려서, 정답이 thinking-image를 거치도록 강제한다. Learnability-Informativeness(L-I) 트레이드오프 프레임워크를 통해 파노라마·탑다운·포인트 매칭 세 가지 시각적 사고 전략을 비교한 결과, 파노라마 시각 사고가 유일하게 두 축에서 모두 높은 점수를 기록하며 최상의 OOD 일반화를 달성했다.

핵심 요약

  • Visual thinking의 핵심 실패 모드인 '생성했지만 사용하지 않음' 문제 식별
  • View Dropout(VDrop): 답변 구간에서 입력 뷰 일부를 마스킹하여 thinking-image를 거치도록 강제하는 훈련 기법
  • Learnability-Informativeness(L-I) 트레이드오프 프레임워크로 세 가지 시각적 사고 표현(파노라마·탑다운·포인트 매칭) 비교
  • 합성 데이터(Infinigen Indoors) 8K 샘플로 훈련 후 5개 실제 OOD 벤치마크에서 평가
  • 파노라마 visual thinking + VDrop이 유일하게 두 축에서 높은 점수를 기록하며 최상 OOD 성능 달성
  • 3× 더 많은 데이터로 학습한 기존 방법들보다도 우수한 6.7포인트 OOD 향상 달성

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)