Qwen-Music Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 606
- 분야
- Research
- arXiv 번호
- 2607.11699
Alibaba Qwen팀의 대규모 음악 생성 모델. 500만 시간 이상의 다국어 음악 데이터로 학습되었으며, Melody-CoT으로 선율을 먼저 계획하는 것이 핵심 혁신이다. Suno V5.5 및 MiniMax와 경쟁하는 수준.
Qwen-Music은 500만 시간 이상의 다국어 음악 데이터로 학습된 대규모 음악 생성 모델로, 텍스트-음악 생성과 커버 곡 생성을 지원한다. 핵심 혁신인 Melody-CoT는 전체 곡 생성 전 선율을 먼저 계획하여 창의성과 구조적 일관성을 향상시키며, 25Hz Music Semantic Token + DiT 기반 렌더링으로 48kHz 스테레오 웨이브폼을 생성한다. Suno V5.5와 동등 수준이며 MiniMax 2.6을 66.7% 승률로 압도한다.
핵심 요약
- 25Hz 단일 코드북 Music Semantic Token으로 곡 전체를 압축 표현하여 LLM 예측 공간 확보
- Melody-CoT 메커니즘으로 선율을 명시적 중간 표현으로 계획 후 토큰 생성하여 음악성·구조 일관성 향상
- Qwen-Music-Render: semantic-conditioned DiT + Spec-VAE + Band-Mode Refiner로 48kHz 스테레오 합성
- 500만 시간+ 다국어 음악 데이터로 학습, 품질 등급별 커리큘럼 + 다단계 post-training(SFT→DPO→GSPO)
- 전문 평가자 블라인드 테스트에서 MiniMax 2.6 대비 66.7%, Mureka V8 대비 58.3% 승률 달성
- 16개 객관적 지표 중 13개에서 SOTA 달성 (SongBench, SongEval, AudioBox-Aesthetic)
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.