OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

발행일
출처
arXiv
논문 번호
734
분야
Computer Vision
arXiv 번호
2607.23855

오디오와 비디오 잠재 공간을 처음으로 명시 정렬한 공동 VAE. 자율랩과는 거리가 있음.

오디오와 비디오를 함께 생성할 때 두 잠재 공간이 어긋나 동기화가 어렵다. OmniVAE는 공동 학습으로 두 공간을 세밀하게 정렬한다. 구간 대조 학습과 의미 증류 두 목표를 재구성 위에 얹었고, 추론 비용은 늘지 않는다. 결과로 동기화와 음질, 영상 품질이 모두 좋아졌다.

핵심 요약

  • 오디오 VAE와 비디오 VAE를 따로 학습하면 잠재 공간이 어긋나 동기화가 어렵다.
  • OmniVAE는 두 공간을 공동 학습으로 세밀하게 정렬한 오디오 비디오 VAE다.
  • 구간 단위 대조 학습으로 시간 의미 대응을 맞춘다.
  • 사전학습 인코더에서 의미 특징을 증류해 각 잠재 공간의 학습성을 높인다.
  • 두 목표 모두 학습 때만 쓰여 추론 비용이 늘지 않는다.
  • Verse-Bench에서 동기화(DeSync 0.884에서 0.570)와 음질이 모두 개선됐다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)