Glob3R: Global Structure-from-Motion with 3D Foundation Models

발행일
출처
arXiv
논문 번호
599
분야
Computer Vision
arXiv 번호
2607.09225

3D 기반 모델의 피드포워드 예측을 전역 SfM 최적화로 변환해 정확도를 크게 높이는 Glob3R 재구성 프레임워크를 제안한다.

Glob3R는 동결된 Pi3X 백본에 경량 밀집 매칭 헤드를 추가해 참조 프레임과 인접 뷰 간의 이미지 왜핑을 예측하고, 이를 다중 뷰 특징 트랙으로 변환해 전역 최적화에 사용한다. 키프레임 기반 슬라이딩 윈도우 전략으로 긴 시퀀스와 비순차 이미지 컬렉션 모두를 처리하며, motion averaging과 bundle adjustment로 포즈를 정제한다. KITTI에서 평균 RMSE 13.21m를 달성해 기존 스트리밍 방법들보다 10~50% 개선했고, ETH3D에서 회전·병진 정확도를 크게 높였다. neural rendering에서도 2~3dB PSNR 향상을 가져왔다.

핵심 요약

  • 동결된 3D 기반 모델(Pi3X) + 경량 밀집 매칭 헤드로 피드포워드 예측을 최적화 가능한 기하 제약으로 변환
  • 키프레임 기반 슬라이딩 윈도우 전략: 트랙과 상대 포즈를 윈도우 간 전파, 청크 단위 한계 극복
  • KITTI 평균 RMSE 13.21m — Scal3R(14.55), LoGeR(18.65) 등 최신 방법 대비 10~50% 개선
  • ETH3D: R@1 91.58, T@1 73.27 — 최신 학습 기반 SfM(AMB3R) 대비 회전·병진 정확도 대폭 향상
  • NeRF/뉴럴 렌더링에서 2~3dB PSNR 향상 — 정제된 포즈의 실용적 가치 입증
  • 전역 motion averaging + bundle adjustment로 스케일 불일치 해소 및 밀집 기하 복원

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)