WanSong v1.0 Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 647
- 분야
- Computer Vision
- arXiv 번호
- 2607.14749
순수 diffusion 기반으로 5분짜리 상업용 음악을 보컬+반주 분리 생성하는 엔드투엔드 모델.
이 논문은 한마디로 기존 AR(자회귀) 방식이 아닌 순수 diffusion로 5분 길이의 다국어 곡을 보컬과 반주를 분리해 한 번에 생성하는 음악 기반 모델이다. 듀얼 스템 토큰 구조로 보컬과 BGM 간 간섭을 없애고, 25B 규모 hybrid-MMDit로 학습한다. 발음 오류율 7.43%로 Suno v5(22.8%)·Mureka(12.7%)를 크게 앞선다.
핵심 요약
- AR 기반 파이프라인을 버리고 순수 diffusion로 5분 길이 곡을 보컬+BGM 듀얼 스템으로 한 번에 생성한다.
- 듀얼 스템 토큰: 보컬과 반주를 독립 토큰으로 모델링해 CFG로 인한 품질 저하 없이 둘 다 고품질로 생성한다.
- 1024 압축률 VAE(기존 2048의 절반)로 미세 음향 디테일을 보존해 SI-SDR +2.86dB 향상을 달성했다.
- RLHF로 음악성·가사 정확도·프롬프트 정렬을 최적화해 musicality 점수 5.49(Suno 4.18, Mureka 3.83)를 기록했다.
- 6M 시간 다국어 데이터와 3단계 커리큘럼(90s→300s→SFT) 학습으로 안정적인 긴 곡 생성을 달성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.