SM4RT: Learning Structured Motion Geometry for 4D Reconstruction

발행일
출처
arXiv
논문 번호
720
분야
Computer Vision
arXiv 번호
2607.22534

비디오에서 3D 장면 구조와 움직임을 한 번에 복원하는 새 방법이다. 움직임을 개별 점이 아니라 '물체 단위의 강체 운동'으로 모델링해서 더 정확하고 자연스럽다.

이 논문은 한마디로 단일 카메라 비디오에서 3D 구조와 물체의 움직임을 동시에 복원하는 새로운 프레임워크 SM4RT다. 기존 방식은 각 점의 움직임을 독립적으로 추적했지만, 이 논문은 움직임을 소수의 '강체 운동 기저(motion basis)'로 분해한다. 즉 같은 물체에 속한 점들은 같은 운동 궤적을 공유하게 만든다. 이렇게 하면 움직임의 자유도가 3HW에서 6N으로 대폭 줄어들어 더 안정적이고 해석 가능한 결과를 얻을 수 있다.

핵심 요약

  • 비디오의 움직임을 개별 점이 아니라 '강체 운동 기저'의 조합으로 표현하는 Structure-of-Motion(SoM) 표현을 제안했다.
  • 하나의 순전파(forward pass)로 3D 기하학, 움직임, 장면의 운동 구조를 동시에 추론한다.
  • Kubric 벤치마크에서 추적 정확도(APD) 90.62로 SOTA 달성, 변형 점수(VM)에서도 압도적 구조 보존 성능을 보였다.
  • DA3 백본이 VGGT 대비 큰 폭으로 우수하며, 단순 선형 결합이 가장 효과적인 특징 융합 방식이었다.
  • 추론 속도 2.86초/샘플로 기존 방법 대비 효율적이며 GPU 메모리 15.72GB로 가볍다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)