Glob3R: Global Structure-from-Motion with 3D Foundation Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 599
- 분야
- Computer Vision
- arXiv 번호
- 2607.09225
3D 기반 모델의 피드포워드 예측을 전역 SfM 최적화로 변환해 정확도를 크게 높이는 Glob3R 재구성 프레임워크를 제안한다.
Glob3R는 동결된 Pi3X 백본에 경량 밀집 매칭 헤드를 추가해 참조 프레임과 인접 뷰 간의 이미지 왜핑을 예측하고, 이를 다중 뷰 특징 트랙으로 변환해 전역 최적화에 사용한다. 키프레임 기반 슬라이딩 윈도우 전략으로 긴 시퀀스와 비순차 이미지 컬렉션 모두를 처리하며, motion averaging과 bundle adjustment로 포즈를 정제한다. KITTI에서 평균 RMSE 13.21m를 달성해 기존 스트리밍 방법들보다 10~50% 개선했고, ETH3D에서 회전·병진 정확도를 크게 높였다. neural rendering에서도 2~3dB PSNR 향상을 가져왔다.
핵심 요약
- 동결된 3D 기반 모델(Pi3X) + 경량 밀집 매칭 헤드로 피드포워드 예측을 최적화 가능한 기하 제약으로 변환
- 키프레임 기반 슬라이딩 윈도우 전략: 트랙과 상대 포즈를 윈도우 간 전파, 청크 단위 한계 극복
- KITTI 평균 RMSE 13.21m — Scal3R(14.55), LoGeR(18.65) 등 최신 방법 대비 10~50% 개선
- ETH3D: R@1 91.58, T@1 73.27 — 최신 학습 기반 SfM(AMB3R) 대비 회전·병진 정확도 대폭 향상
- NeRF/뉴럴 렌더링에서 2~3dB PSNR 향상 — 정제된 포즈의 실용적 가치 입증
- 전역 motion averaging + bundle adjustment로 스케일 불일치 해소 및 밀집 기하 복원
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.