V-RAE: Rethinking Video Latent Spaces for Generation

발행일
출처
arXiv
논문 번호
895
분야
Computer Vision
arXiv 번호
2608.13556

영상 생성용 잠재 공간을 '화질 복원'이 아니라 '의미 보존'으로 다시 설계하면 생성 품질과 학습 속도가 함께 좋아진다는 논문.

이 논문은 한마디로 영상 생성 모델이 쓰는 압축 공간(잠재 공간)은 화질 복원이 아니라 의미를 얼마나 담느냐가 중요하다는 걸 보여준다. 저자들은 학습이 멈춰 있는(얼어 있는) 시각 기반 모델의 특징 위에 가벼운 시간 압축 모듈을 얹어 V-RAE를 만들었다. 결과는 복원 품질도 최상위(K600 rFVD 2.13)인데, 생성 품질은 더 좋아지고 학습 수렴은 최대 6배 빨라졌다. 또한 복원 점수가 좋다고 생성에 좋은 공간은 아니라는 걸 보여주는 새 진단 지표 tFVD를 제안했다.

핵심 요약

  • 영상 잠재 공간을 화소 복원용으로 학습하는 대신, 얼어 있는 시각 기반 모델의 의미 있는 특징 공간 위에 구축했다.
  • K600 복원에서 rFVD 2.13으로 평가 대상 대형 영상 VAE를 모두 앞질렀고, 잠재 공간의 의미 정보 보존도 훨씬 좋았다(UCF101 분류 89.13% vs VAE 최고 30.83%).
  • 같은 학습 조건에서 생성 품질(gFVD)도 앞서고 수렴은 최대 6배 빨랐다.
  • 복원 점수(rFVD)와 생성 품질의 순위가 크게 달라진다는 걸 보여주고, 생성 적합성을 더 잘 반영하는 tFVD 지표를 제안했다.
  • Cityscapes 미래 영상 예측에서도 Wan 2.2 VAE 잠재 공간보다 나은 결과를 냈다(gFVD 111.36 vs 144.47).

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)