Depth Anything V4: Dynamic 4D Scene Reconstruction via Riemannian Flow Matching on 4D Gaussian Splatting

발행일
출처
arXiv
논문 번호
951
분야
Computer Vision
arXiv 번호
2608.18388

일반 동영상 한 개로 움직이는 4D 장면을 복원한다. 핵심은 리만 플로우 매칭(다양체 위에서 확률 경로를 학습하는 생성 기법)을 4D 가우시안 스플래팅 파라미터에 적용한 것.

이 논문은 한마디로 모노큘러(한 대 카메라) 동영상만으로 시간에 따라 움직이는 4D 장면을 복원하는 Depth Anything V4를 제안했다. 핵심 아이디어는 가우시안 스플래팅(장면을 수많은 작은 타원체로 표현하는 3D 표현 방식)의 파라미터가 평면 공간이 아닌 다양체(휘어진 공간) 위에 있다는 점을 반영해, 리만 플로우 매칭으로 그 위에서 직접 확률 경로를 학습하는 것이다. 이러면 중간 상태가 항상 유효한 가우시안(음수 크기 같은 불가능한 값이 없는)으로 유지된다. 같은 데이터·구조·테스트타임 최적화를 쓴 결정론적 MLP 대비 F-score가 0.762에서 0.806으로 +0.044 올라, 이득이 플로우 매칭에서 온다는 걸 통제 실험으로 증명했다. 사람이 라벨링한 깊이 정답 없이 자기지도 손실만으로 학습했고, 불확실성 추정의 보정 품질도 앙상블 기법보다 좋았다.

핵심 요약

  • 가우시안 스플래팅의 파라미터(크기·회전·불투명도)는 휘어진 공간 위에 있어서, 평면 공간에서 선형 보간하면 중간에 '불가능한' 값이 나온다. 다양체 위에서 보간하니 항상 유효한 상태가 유지됐다.
  • 동일한 데이터·구조·테스트타임 최적화 조건에서 결정론적 MLP는 F-score 0.762, 리만 플로우 매칭은 0.806. +0.044가 플로우 매칭만의 순수 기여다.
  • 평면 공간 버전은 12.3%의 가우시안이 불가능한 값이 되고 F-score 0.684에 그쳤다.
  • 불확실성 보정에서 MC-Dropout보다 NGLL -1.58 vs -0.82, ECE 0.058 vs 0.18로 훨씬 정확했다. 확신해야 할 때 확신하고 모르면 모른다고 잘 말하는 셈이다.
  • 사람이 라벨링한 깊이 정답 없이 학습해도 기존 Depth Anything 계열과 씬별 최적화 4D-GS를 능가했다. 사전학습 비용 360 GPU시간은 1만 씬 이상 배포 시 씬별 최적화보다 저렴해진다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)