You Don't Need Strong Assumptions: Visual Representation Learning via Temporal Differences
- 발행일
- 출처
- arXiv
- 논문 번호
- 432
- 분야
- Computer Vision
- arXiv 번호
- 2606.15956
비디오에서 인과성(과거→미래) 가정만으로 자기지도학습을 수행하는 TDV(Temporal Difference in Vision)를 제안한다. augmentation, masking, cropping 등 기존 inductive bias 없이도 DINO, iBOT과 동등한 성능을 달성한다.
TDV는 시간 인접 프레임 간의 인과적 관계를 활용하여 시각 표현을 학습하는 새로운 패러다임이다. 현재 프레임 표현과 motion encoder가 생성한 delta를 더해 다음 프레임 표현을 예측하는 구조로, 비디오의 높은 시간 일관성을 활용한다. SSv2 데이터셋에서 사전학습 후 ADE-20K semantic segmentation, MPI-Sintel optical flow 등 dense spatial task에서 DINO/iBOT과 경쟁력 있는 성능을 보인다.
핵심 요약
- 강한 inductive bias(augmentation, masking, cropping) 없이 인과성 가정만으로 자기지도학습을 수행하는 최초의 접근
- frame encoder와 motion encoder를 joint training하여 현재 프레임 + motion delta = 다음 프레임 표현을 학습
- 데이터 규모가 커질수록 약한 inductive bias가 유리한다는 가설을 실험적으로 검증
- ADE-20K semantic segmentation 및 MPI-Sintel optical flow에서 DINO/iBOT과 동등한 성능 달성
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.