Surflo: Consistent 3D Surface Flow Model with Global State

발행일
출처
arXiv
논문 번호
414
분야
Computer Vision
arXiv 번호
2606.13644

여러 미포즈 RGB 이미지를 단일 global latent로 압축하고 flow matching으로 임의 해상도의 3D 표면점을 복원하는 Surflo를 제안한다.

Surflo는 임의 개수의 unposed RGB 이미지를 K개 latent token으로 압축한 뒤, flow matching을 통해 3D 표면점(point + normal)을 독립적으로 복원하는 feed-forward 3D 재구성 모델이다. 기존 per-view 방식의 view-wise 중복 문제와 global-latent 방식의 고정 해상도 한계를 동시에 해결한다. 동일한 latent에서 수천 개부터 100만 개까지 임의 해상도의 점을 복원할 수 있으며, inference-time photometric guidance로 점 간 일관성을 확보한다. 8개 3D 재구성 벤치마크에서 feed-forward 방법 중 최고 수준의 표면 품질을 달성했다.

핵심 요약

  • Variable-view 입력을 K latent token으로 압축(frozen VGGT backbone + Perceiver 압축), view 수와 무관한 고정 크기 표현
  • Flow matching 디코더로 각 점을 독립적으로 noise에서 표면으로 transport — 임의 해상도(수천~100만 점) 지원
  • Inference-time photometric + monodepth guidance로 독립 디코딩의 국부 불일치 해결
  • Per-view(pointmap 중복)와 global-latent(고정 해상도) 방식의 한계를 동시에 극복한 유일한 feed-forward 방법
  • 8개 3D 재구성 벤치마크에서 feed-forward 최고 수준, optimization-based 대비 10배 이상 빠름
  • DL3DV ~10.5K 씬에 watertight mesh를 추가한 데이터셋 구축 및 공개 예정

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)