World from Motion: Generative Dynamic Gaussian Reconstruction from Monocular Video

발행일
출처
arXiv
논문 번호
547
분야
Computer Vision
arXiv 번호
2607.01202

단안 비디오에서 자유롭게 렌더링 가능한 동적 3D Gaussian 표현을 생성하는 방법. 비디오 생성 모델과 4D 재구성을 통합하여 SOTA 달성.

World from Motion은 단안 비디오에서 렌더링 가능한 동적 3DGS 표현을 생성하는 프레임워크로, 초기 재구성의 appearance·geometry·3D scene motion을 밀집 렌더링하여 비디오 생성 모델에 조건부 입력으로 제공한다. 생성된 고품질 가상 시점 관측을 다시 4D 표현으로 증류하여 DyCheck 벤치마크에서 지각적 품질 SOTA를 달성했으며, 동적 3DGS의 모션 품질도 향상시킨다. 야생 비디오(in-the-wild)에 대한 일반화도 입증했다.

핵심 요약

  • 최초로 비디오 생성 모델을 동적 3DGS 표현에 조건부화하는 방법 제안 — geometry, appearance, 3D motion을 reference/target 뷰 따라 렌더링
  • DyCheck 벤치마크 mPSNR 19.98, mSSIM 0.716, mLPIPS 0.178로 모든 기준에서 SOTA 달성
  • 생성된 샘플을 다시 동적 3DGS로 증류하는 최적화 과정에서 3D track 정확도도 향상 (PCK@0.05: MoSca 0.824 → 0.862)
  • 가상 카메라 수가 증가할수록 재구성 품질이 단조 향상되며 8대 이후 수렴 (mPSNR 18.69→19.78)
  • CAT4D, Vista4D 등 생성 기반 방법 및 WorldTree, ViDAR 등 재구성 기반 방법 모두 능가
  • 야생 비디오에서 visual outpainting, 동역학 교정, 시야 외 동역학 추론까지 수행 가능

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)