OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 734
- 분야
- Computer Vision
- arXiv 번호
- 2607.23855
오디오와 비디오 잠재 공간을 처음으로 명시 정렬한 공동 VAE. 자율랩과는 거리가 있음.
오디오와 비디오를 함께 생성할 때 두 잠재 공간이 어긋나 동기화가 어렵다. OmniVAE는 공동 학습으로 두 공간을 세밀하게 정렬한다. 구간 대조 학습과 의미 증류 두 목표를 재구성 위에 얹었고, 추론 비용은 늘지 않는다. 결과로 동기화와 음질, 영상 품질이 모두 좋아졌다.
핵심 요약
- 오디오 VAE와 비디오 VAE를 따로 학습하면 잠재 공간이 어긋나 동기화가 어렵다.
- OmniVAE는 두 공간을 공동 학습으로 세밀하게 정렬한 오디오 비디오 VAE다.
- 구간 단위 대조 학습으로 시간 의미 대응을 맞춘다.
- 사전학습 인코더에서 의미 특징을 증류해 각 잠재 공간의 학습성을 높인다.
- 두 목표 모두 학습 때만 쓰여 추론 비용이 늘지 않는다.
- Verse-Bench에서 동기화(DeSync 0.884에서 0.570)와 음질이 모두 개선됐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.