Qwen-Audio-3.0-Gen-Preview Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 760
- 분야
- Research
- arXiv 번호
- 2607.27011
음성, 음악, 효과음, 환경음을 하나의 모델에서 통합 생성하는 오디오 생성 모델.
이 논문은 한마디로 말·음악·효과음·환경음을 하나의 모델에서 통합해서 만들어내는 오디오 생성 시스템이다. 기존은 각 소리 종류별로 별도 모델이 필요했지만, Qwen-Audio-3.0-Gen은 확산 트랜스포머(DiT)와 공유 VAE로 한 번에 혼합 오디오를 생성한다. 음악 학습 데이터의 10%만 써도 전용 모델과 비슷한 성능을 내고, 화자 유사도와 시간 정렬에서 강점을 보였다.
핵심 요약
- 비자기회귀(NAR) 구조로 음성·음악·효과음·혼합을 단일 생성 경로로 통합했다.
- 48kHz 스테레오를 25Hz 잠재 표현으로 압축하는 공유 VAE를 설계했다.
- 음악 데이터를 기존 전용 모델의 약 10%만 사용하면서도 SongBench 7개 항목 중 3개에서 리드했다.
- Seed-TTS-Eval에서 화자 유사도가 가장 높았고, 다화자 일관성도 Seed-Audio-1.0보다 뛰어났다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.