How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 266
- 분야
- Computer Vision
- arXiv 번호
- 2605.27310
통합 멀티모달 모델(UMM)에서 교차 시점 공간 추론을 위해 시각적 사고(visual thinking)가 실제로 작동하게 만드는 View Dropout(VDrop) 훈련 기법과 최적의 시각적 표현 유형을 분석한다.
본 연구는 통합 멀티모달 모델에서 교차 시점 공간 추론을 할 때 생성되는 thinking-image가 실제로 활용되도록 만드는 View Dropout(VDrop) 훈련 기법을 제안한다. VDrop은 답변 구간에서 한 입력 뷰의 일부를 가려서, 정답이 thinking-image를 거치도록 강제한다. Learnability-Informativeness(L-I) 트레이드오프 프레임워크를 통해 파노라마·탑다운·포인트 매칭 세 가지 시각적 사고 전략을 비교한 결과, 파노라마 시각 사고가 유일하게 두 축에서 모두 높은 점수를 기록하며 최상의 OOD 일반화를 달성했다.
핵심 요약
- Visual thinking의 핵심 실패 모드인 '생성했지만 사용하지 않음' 문제 식별
- View Dropout(VDrop): 답변 구간에서 입력 뷰 일부를 마스킹하여 thinking-image를 거치도록 강제하는 훈련 기법
- Learnability-Informativeness(L-I) 트레이드오프 프레임워크로 세 가지 시각적 사고 표현(파노라마·탑다운·포인트 매칭) 비교
- 합성 데이터(Infinigen Indoors) 8K 샘플로 훈련 후 5개 실제 OOD 벤치마크에서 평가
- 파노라마 visual thinking + VDrop이 유일하게 두 축에서 높은 점수를 기록하며 최상 OOD 성능 달성
- 3× 더 많은 데이터로 학습한 기존 방법들보다도 우수한 6.7포인트 OOD 향상 달성
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.