Self-Supervised Learning of Structured Dynamics from Videos
- 발행일
- 출처
- arXiv
- 논문 번호
- 712
- 분야
- Computer Vision
- arXiv 번호
- 2607.21576
비디오에서 카메라 움직임과 객체 움직임을 자동으로 분리하는 구조적 동역학 모델(SDM)을 제안했다.
이 논문은 한마디로 비디오 속 움직임을 '카메라 움직임'과 '객체 움직임'으로 자동 분리하는 방법을 제안한다. 저자들은 얼어있는(frozen) 이미지 인코더 위에 구조적 동역학 모델(SDM)을 올려서, 주요 움직임을 담는 primary 토큰과 나머지를 담는 residual 토큰 두 개로 분해했다. 합성 데이터(Kubric)로 약한 감독을 주고 실제 비디오로 자기지도학습을 한다. VGGT 같은 강하게 지도학습된 모델과 비슷한 성능을 내면서도 훨씬 적은 라벨을 사용했다.
핵심 요약
- 비디오의 움직임을 카메라 움직임(primary)과 객체 움직임(residual) 두 개의 토큰으로 구조화하는 SDM을 제안했다.
- 얼어있는 이미지 백본(DINOv2) 위에 가벼운 모델을 올려서 비디오 전처리학습 없이도 동역학 표현을 학습한다.
- ProbeMotion이라 새로운 평가 벤치마크를 만들어 합성/실제 비디오에서 체계적으로 측정했다.
- VGGT(17개 데이터셋으로 학습)와 비슷하거나 일부에서 더 좋은 성능을 약한 감독만으로 달성했다.
- primary 토큰은 카메라 이동 장면에서 카메라를, 정지 카메라 장면에서는 객체를 포착하는 식으로 자동 적응한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.