Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement

발행일
출처
arXiv
논문 번호
674
분야
Computer Vision
arXiv 번호
2607.17967

단일 사진에서 3D 형태를 뽑을 때 생기는 가는 구조물 뭉개짐을, 2D 평면 대신 3D 희소 복셀 공간에서 다듬어 해결한 논문이다.

사진 한 장으로 3D 좌표를 예측하는 기존 모델은 전체 배치는 그럴듯해도 울타리나 기둥 같은 가늘고 긴 물체가 뒤틀린다. 저자들은 원인을 구조적 불일치로 본다. 3D 기하를 2D 이미지 평면 위에서 디코딩하다 보니, 화면에서만 가까울 뿐 실제로는 멀리 떨어진 면의 특징이 섞인다는 것이다. 이를 풀려고 기반 모델 MoGe-2가 낸 거친 점 지도를 희소 복셀(빈 공간을 빼고 물체가 있는 칸만 저장하는 3차원 격자) 껍질로 올린 뒤, 3D 희소 합성곱 U-Net으로 반복해서 깊이 보정값을 예측하는 SSR 모듈을 붙였다. 여러 데이터셋의 제로샷 평가에서 국소 기하 정확도가 크게 올랐고 전역 정확도는 그대로 유지됐다.

핵심 요약

  • 기존 단안 기하 추정 모델의 한계를 성능 부족이 아니라 구조 불일치로 진단했다. 3D 정보를 2D 좌표계에서 디코딩하면 깊이 경계를 넘어 특징이 섞인다.
  • 해법은 기하 모델링을 2D 이미지 평면에서 3D 공간으로 올리는 것이다. 특징 이웃 관계를 화면 거리 대신 3D 거리로 정의한다.
  • 점 지도를 (X/Z, Y/Z, log Z)로 바꿔 로그 깊이만 보정하도록 만들고, 이 값을 해상도 D로 양자화해 희소 복셀 껍질을 만든다.
  • 희소 3D U-Net이 각 반복마다 로그 깊이 잔차를 예측하고, 그 결과가 다음 반복의 복셀 구조를 다시 정한다. 이 자기 유도 방식 덕에 계산량이 점유 복셀 수에 비례한다.
  • 파라미터 수를 맞춘 2D U-Net 대체 실험에서는 국소 지표가 기반 모델과 비슷하거나 오히려 나빠졌다. 개선의 원인이 용량이 아니라 3D 귀납 편향임을 보였다.
  • K=3으로 학습했는데 추론에서 K=7까지 늘려도 지표가 유지되거나 조금 좋아졌다. 학습한 보정이 안정적으로 수렴한다는 뜻이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)