SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
- 발행일
- 출처
- arXiv
- 논문 번호
- 804
- 분야
- Research
- arXiv 번호
- 2608.02023
참조 음성으로 목소리를 복제하는 방식과 자연어 설명으로 목소리를 새로 만드는 방식을 한 모델에 합치고, 말소리와 배경음과 효과음을 한 파형으로 같이 생성하는 음성 생성 모델이다.
더빙과 오디오 드라마 같은 제작 현장에서는 참조 녹음이 아예 없는 캐릭터 목소리를 새로 설계해야 하는데, 기존 시스템은 참조 음성 방식과 자연어 지시 방식을 한 모델에서 같이 다루지 못했다. 저자들은 먼저 SwanData-Caption이라는 데이터 파이프라인으로 환경, 화자 스타일, 세밀한 내용을 층으로 나눠 설명하는 캡션 약 7천만 건을 만든다. 모델 쪽에서는 SwanVAE와 흐름 기반 트랜스포머 위에 보상 조건부 품질 제어, Engram 조건화, 작업 라우터와 오디오 라우터를 가진 Unified MoE를 얹고, 쉬운 것부터 차례로 가르치는 커리큘럼 학습과 강화학습 기반 후속 학습인 GRPO를 적용한다. 그 결과 SwanTale은 참조 음성 방식과 지시 방식 여러 지표에서 앞서고 표현력 점수에서 가장 좋은 값을 얻는다.
핵심 요약
- 음성 전처리와 다층 캡션, 품질 정제 및 희귀 상황 합성으로 환경·화자·내용을 설명하는 약 7000만 건의 학습 기록을 구성했다.
- SwanVAE와 흐름 기반 트랜스포머에 품질 조건, Engram, 통합 전문가 혼합을 결합해 참조 음성과 자연어 지시를 한 모델에서 처리했다.
- 참조 음성 단일 화자 평가에서 음색 일치도 0.95와 내용 오류 0.086을 기록하며 이전 SwanVoice보다 좋아졌다.
- 지시 평가에서 중국어 APS 86.1로 1위, 영어 APS 84.2로 공동 1위를 기록했고 말소리와 환경음·효과음을 한 파형으로 만들 수 있었다.
- 복잡한 배경음악의 감정 전환과 2분이 넘는 다화자 장면, 특정 화자의 연속 감정·강세·쉼표 제어 및 역할 연기는 여전히 약점이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.