WanSong v1.0 Technical Report

발행일
출처
arXiv
논문 번호
647
분야
Computer Vision
arXiv 번호
2607.14749

순수 diffusion 기반으로 5분짜리 상업용 음악을 보컬+반주 분리 생성하는 엔드투엔드 모델.

이 논문은 한마디로 기존 AR(자회귀) 방식이 아닌 순수 diffusion로 5분 길이의 다국어 곡을 보컬과 반주를 분리해 한 번에 생성하는 음악 기반 모델이다. 듀얼 스템 토큰 구조로 보컬과 BGM 간 간섭을 없애고, 25B 규모 hybrid-MMDit로 학습한다. 발음 오류율 7.43%로 Suno v5(22.8%)·Mureka(12.7%)를 크게 앞선다.

핵심 요약

  • AR 기반 파이프라인을 버리고 순수 diffusion로 5분 길이 곡을 보컬+BGM 듀얼 스템으로 한 번에 생성한다.
  • 듀얼 스템 토큰: 보컬과 반주를 독립 토큰으로 모델링해 CFG로 인한 품질 저하 없이 둘 다 고품질로 생성한다.
  • 1024 압축률 VAE(기존 2048의 절반)로 미세 음향 디테일을 보존해 SI-SDR +2.86dB 향상을 달성했다.
  • RLHF로 음악성·가사 정확도·프롬프트 정렬을 최적화해 musicality 점수 5.49(Suno 4.18, Mureka 3.83)를 기록했다.
  • 6M 시간 다국어 데이터와 3단계 커리큘럼(90s→300s→SFT) 학습으로 안정적인 긴 곡 생성을 달성했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)