VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

발행일
출처
arXiv
논문 번호
634
분야
Computer Vision
arXiv 번호
2607.14088

동결된 비디오 파운데이션 모델을 인코더로 활용하여 생성 친화적 잠재 공간을 구축하는 비디오 오토인코더.

VideoRAE는 동결된 비디오 파운데이션 모델(VFM)의 표현을 활용해 생성 친화적 잠재 공간을 구축하는 혁신적 비디오 오토인코더다. 기존 3D-VAE가 픽셀 수준 복원에만 최적화된 한계를 극복하고, VFM의 의미론적으로 풍부한 표현을 경량 1D 어텐션 프로젝터로 압축하여 continuous(DiT용) 및 discrete(AR용) 잠재 표현을 모두 지원한다. UCF-101에서 AR gFVD 40, DiT gFVD 93으로 SOTA 달성 및 경쟁 모델 대비 약 5배 빠른 수렴을 보였다.

핵심 요약

  • 동결된 비디오 파운데이션 인코더의 여러 계층 특징을 가벼운 1차원 자기어텐션 프로젝터로 압축한다.
  • 연속 잠재표현은 확산 Transformer에, 다중 코드북 양자화로 만든 이산 토큰은 자기회귀 모델에 사용할 수 있다.
  • UCF-101에서 자기회귀와 확산 생성기의 gFVD가 각각 40과 93을 기록했고 경쟁 오토인코더보다 약 5배 빨리 수렴했다.
  • 의미가 풍부한 동결 비디오 표현을 복원 가능한 생성 잠재공간으로 바꿔 비디오 생성 학습을 빠르게 할 수 있다.
  • 생성 결과는 주로 UCF-101과 통제된 2B 규모 텍스트-비디오 실험에서 확인됐으므로 더 큰 모델과 다양한 영상 영역의 검증이 남아 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)