Video Generation Models are General-Purpose Vision Learners
- 발행일
- 출처
- arXiv
- 논문 번호
- 593
- 분야
- Computer Vision
- arXiv 번호
- 2607.09024
비디오 생성 모델을 사전학습 백본으로 활용해 다양한 비전 인식 태스크를 수행하는 통합 모델 GenCeption을 제안한다.
Google DeepMind의 GenCeption은 사전학습된 비디오 확산 모델을 백본으로 사용해 깊이, 법선, 카메라 포즈, 세그먼테이션, 3D 키포인트 등 다양한 비전 태스크를 단일 아키텍처로 수행하는 범용 인식 모델이다. 기존 전용 모델들(DepthAnything3, SAM3, D4RT 등)과 동등하거나 더 나은 성능을 달성하면서도 학습 데이터는 7~500배 적게 사용한다. 합성 데이터로만 학습했음에도 실제 영상과 분포 외 객체(동물, 로봇)로 일반화되는 창발적 행동도 보여준다.
핵심 요약
- 비디오 생성 확산 모델을 다용도 비전 인식의 사전학습 패러다임으로 제안 — NLP의 next-token prediction에 해당하는 비전의 촉매 역할
- 반복적 디노이징을 단일 순방향 패스로 변환해 depth, normal, segmentation, pose, keypoint 등을 텍스트指令로 제어
- D4RT, VGGT-Ω 등 최고 성능 전용 모델과 동등하거나 우수하면서 학습 데이터는 7~500배 적게 요구
- V-JEPA, VideoMAE V2 등 기존 사전학습 방식 대비 확산 기반 사전학습이 우수함을 실험적으로 입증
- 합성 human 비디오만으로 학습해도 실제 영상·OOD 객체로 zero-shot 일반화 발생 — 세계 모델 내재의 증거
- 전용 헤드·손실 없이 통합 backbone+head+loss 구조로 태스크 확장이 데이터 포맷 설계만으로 가능
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.