V-RAE: Rethinking Video Latent Spaces for Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 895
- 분야
- Computer Vision
- arXiv 번호
- 2608.13556
영상 생성용 잠재 공간을 '화질 복원'이 아니라 '의미 보존'으로 다시 설계하면 생성 품질과 학습 속도가 함께 좋아진다는 논문.
이 논문은 한마디로 영상 생성 모델이 쓰는 압축 공간(잠재 공간)은 화질 복원이 아니라 의미를 얼마나 담느냐가 중요하다는 걸 보여준다. 저자들은 학습이 멈춰 있는(얼어 있는) 시각 기반 모델의 특징 위에 가벼운 시간 압축 모듈을 얹어 V-RAE를 만들었다. 결과는 복원 품질도 최상위(K600 rFVD 2.13)인데, 생성 품질은 더 좋아지고 학습 수렴은 최대 6배 빨라졌다. 또한 복원 점수가 좋다고 생성에 좋은 공간은 아니라는 걸 보여주는 새 진단 지표 tFVD를 제안했다.
핵심 요약
- 영상 잠재 공간을 화소 복원용으로 학습하는 대신, 얼어 있는 시각 기반 모델의 의미 있는 특징 공간 위에 구축했다.
- K600 복원에서 rFVD 2.13으로 평가 대상 대형 영상 VAE를 모두 앞질렀고, 잠재 공간의 의미 정보 보존도 훨씬 좋았다(UCF101 분류 89.13% vs VAE 최고 30.83%).
- 같은 학습 조건에서 생성 품질(gFVD)도 앞서고 수렴은 최대 6배 빨랐다.
- 복원 점수(rFVD)와 생성 품질의 순위가 크게 달라진다는 걸 보여주고, 생성 적합성을 더 잘 반영하는 tFVD 지표를 제안했다.
- Cityscapes 미래 영상 예측에서도 Wan 2.2 VAE 잠재 공간보다 나은 결과를 냈다(gFVD 111.36 vs 144.47).
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.