Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild

발행일
출처
arXiv
논문 번호
484
분야
Computer Vision
arXiv 번호
2606.23688

단안 비디오에서 비강체 변형 객체의 완전한 4D 재구성을 수행하는 test-time 최적화 프레임워크로, 인과 잠재 조건화와 가림 인식 최적화를 결합한다.

단일 비디오에서 비강체 변형 객체의 360도 4D 재구성을 수행하는 Lift4D를 제안한다. 단안 3D 재구성 모델에 인과적 잠재 조건화(causal latent conditioning)를 적용해 시간적 일관성을 확보하고, 변형 가능한 3D Gaussian Splatting 표현을 초기화한다. 이후 가림 인식 최적화로 가시 표면 디테일을 복원하면서 보이지 않는 영역은 view-conditioned diffusion prior로 완성한다. Pexels와 DAVIS in-the-wild 비디오에서 기존 방법 대비 CLIP, LPIPS, EPE(모션 정확도) 모두에서 SOTA를 달성했다.

핵심 요약

  • 단안 3D 재구성 모델에 인과적 잠재 조건화를 적용해 프레임 간 시간적 일관성 확보
  • 시간 일관된 초기화를 변형 가능한 3D Gaussian Splatting 표현으로 변환
  • 깊이 단서로 가림 영역을 국소화하는 가림 인식 렌더링 감독으로 가시/비가시 영역 분리 처리
  • 보이지 않는 영역에 view-conditioned diffusion prior를 적용하여 그럴듯한 외형 완성
  • Consistent4D 합성 벤치마크에서 LPIPS 0.116, FVD 592.44로 SOTA 달성
  • DAVIS in-the-wild 비디오에서 CLIP 0.715, EPE 0.161로 기존 최고 방법 대비 우수한 모션 정확도 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)