Qwen-Audio-3.0-Gen-Preview Technical Report

발행일
출처
arXiv
논문 번호
760
분야
Research
arXiv 번호
2607.27011

음성, 음악, 효과음, 환경음을 하나의 모델에서 통합 생성하는 오디오 생성 모델.

이 논문은 한마디로 말·음악·효과음·환경음을 하나의 모델에서 통합해서 만들어내는 오디오 생성 시스템이다. 기존은 각 소리 종류별로 별도 모델이 필요했지만, Qwen-Audio-3.0-Gen은 확산 트랜스포머(DiT)와 공유 VAE로 한 번에 혼합 오디오를 생성한다. 음악 학습 데이터의 10%만 써도 전용 모델과 비슷한 성능을 내고, 화자 유사도와 시간 정렬에서 강점을 보였다.

핵심 요약

  • 비자기회귀(NAR) 구조로 음성·음악·효과음·혼합을 단일 생성 경로로 통합했다.
  • 48kHz 스테레오를 25Hz 잠재 표현으로 압축하는 공유 VAE를 설계했다.
  • 음악 데이터를 기존 전용 모델의 약 10%만 사용하면서도 SongBench 7개 항목 중 3개에서 리드했다.
  • Seed-TTS-Eval에서 화자 유사도가 가장 높았고, 다화자 일관성도 Seed-Audio-1.0보다 뛰어났다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)