Qwen-Music Technical Report

발행일
출처
arXiv
논문 번호
606
분야
Research
arXiv 번호
2607.11699

Alibaba Qwen팀의 대규모 음악 생성 모델. 500만 시간 이상의 다국어 음악 데이터로 학습되었으며, Melody-CoT으로 선율을 먼저 계획하는 것이 핵심 혁신이다. Suno V5.5 및 MiniMax와 경쟁하는 수준.

Qwen-Music은 500만 시간 이상의 다국어 음악 데이터로 학습된 대규모 음악 생성 모델로, 텍스트-음악 생성과 커버 곡 생성을 지원한다. 핵심 혁신인 Melody-CoT는 전체 곡 생성 전 선율을 먼저 계획하여 창의성과 구조적 일관성을 향상시키며, 25Hz Music Semantic Token + DiT 기반 렌더링으로 48kHz 스테레오 웨이브폼을 생성한다. Suno V5.5와 동등 수준이며 MiniMax 2.6을 66.7% 승률로 압도한다.

핵심 요약

  • 25Hz 단일 코드북 Music Semantic Token으로 곡 전체를 압축 표현하여 LLM 예측 공간 확보
  • Melody-CoT 메커니즘으로 선율을 명시적 중간 표현으로 계획 후 토큰 생성하여 음악성·구조 일관성 향상
  • Qwen-Music-Render: semantic-conditioned DiT + Spec-VAE + Band-Mode Refiner로 48kHz 스테레오 합성
  • 500만 시간+ 다국어 음악 데이터로 학습, 품질 등급별 커리큘럼 + 다단계 post-training(SFT→DPO→GSPO)
  • 전문 평가자 블라인드 테스트에서 MiniMax 2.6 대비 66.7%, Mureka V8 대비 58.3% 승률 달성
  • 16개 객관적 지표 중 13개에서 SOTA 달성 (SongBench, SongEval, AudioBox-Aesthetic)

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)