Self-Supervised Learning of Structured Dynamics from Videos

발행일
출처
arXiv
논문 번호
712
분야
Computer Vision
arXiv 번호
2607.21576

비디오에서 카메라 움직임과 객체 움직임을 자동으로 분리하는 구조적 동역학 모델(SDM)을 제안했다.

이 논문은 한마디로 비디오 속 움직임을 '카메라 움직임'과 '객체 움직임'으로 자동 분리하는 방법을 제안한다. 저자들은 얼어있는(frozen) 이미지 인코더 위에 구조적 동역학 모델(SDM)을 올려서, 주요 움직임을 담는 primary 토큰과 나머지를 담는 residual 토큰 두 개로 분해했다. 합성 데이터(Kubric)로 약한 감독을 주고 실제 비디오로 자기지도학습을 한다. VGGT 같은 강하게 지도학습된 모델과 비슷한 성능을 내면서도 훨씬 적은 라벨을 사용했다.

핵심 요약

  • 비디오의 움직임을 카메라 움직임(primary)과 객체 움직임(residual) 두 개의 토큰으로 구조화하는 SDM을 제안했다.
  • 얼어있는 이미지 백본(DINOv2) 위에 가벼운 모델을 올려서 비디오 전처리학습 없이도 동역학 표현을 학습한다.
  • ProbeMotion이라 새로운 평가 벤치마크를 만들어 합성/실제 비디오에서 체계적으로 측정했다.
  • VGGT(17개 데이터셋으로 학습)와 비슷하거나 일부에서 더 좋은 성능을 약한 감독만으로 달성했다.
  • primary 토큰은 카메라 이동 장면에서 카메라를, 정지 카메라 장면에서는 객체를 포착하는 식으로 자동 적응한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)