InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

발행일
출처
arXiv
논문 번호
806
분야
Computer Vision
arXiv 번호
2608.02437

사진 한 장에서 3D 장면을 한 번에 만들어 새 시점 영상을 그려내는 방법이다. 가우시안을 픽셀 격자에 고정하지 않고 깊이로 추정한 표면 위에 배치해서, 카메라를 크게 옮겨도 구조가 덜 깨진다.

사진 한 장으로 3D 가우시안 장면을 바로 만드는 기존 방법들은 가우시안을 이미지 픽셀 격자 위치에 고정해서 만든다. 그래서 입력 시점 근처는 잘 나오지만 카메라를 옆으로 크게 옮기면 면이 찢어지고 구멍이 생긴다. InfiniSplat은 먼저 단안 깊이 사전지식으로 표면 구조를 따라 2D 지지점(가우시안을 어디에 놓을지 정하는 기준점)을 뿌린다. 그다음 그 지지점에서 이미지 특징을 조회해 가우시안 속성을 예측하는 암시적 디코더를 쓴다. DINO 분기와 CNN 분기를 함께 쓰는 이중 인코더로 의미 정보와 국소 질감을 모두 담는다. Hypersim 실내 합성 데이터로만 학습하고 ETH3D, ScanNet++, Tanks and Temples, DL3DV에서 평가해 기존 단일 이미지 방법 대비 최고 성능을 냈다.

핵심 요약

  • 단안 깊이로 추정한 국소 표면에 가우시안 지지점을 놓고, 그 위치에서 조회한 영상 특징으로 가우시안 속성을 예측하는 암시적 해독기를 만들었다.
  • 고정 픽셀 격자에서 지지점과 속성 예측을 떼어내 큰 시점 이동에서도 표면 균열과 흩어진 점을 줄이는 구조를 얻었다.
  • 합성 실내 자료 Hypersim으로만 학습한 뒤 ETH3D와 ScanNet++, Tanks and Temples, DL3DV에서 기존 단일 영상 순전파 방법보다 높은 결과를 냈다.
  • 한 번의 순전파로 실시간 렌더링 가능한 3차원 표현을 만들어 공간 사진 탐색과 증강·가상현실 화면에 적용할 가능성을 보였다.
  • 한 장에서 보이지 않는 영역은 알 수 없고 잘못된 깊이 추정이 지지점 배치에 바로 번져, 반사·투명·얇은 물체와 극단적 시점 이동에서 구조 왜곡이 남는다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)