dots.tts Technical Report

발행일
출처
arXiv
논문 번호
364
분야
AI / General
arXiv 번호
2606.07080

2B 파라미터 연속 잠재 공간 기반 end-to-end 자유회귀 TTS 모델로, 기존 오픈소스 시스템 대비 최고 수준의 안정성과 제로샷 음성 클로닝 품질을 달성했다.

dots.tts는 이산 토큰 대신 연속 잠재 공간에서 음성을 모델링하는 2B 파라미터 TTS 파운데이션 모델이다. 핵심 혁신은 세 가지다. 첫째, WavLM 정렬 손실과 멀티태스크 다운스트림 블록으로 의미적으로 구조화된 AudioVAE를 구축했다. 둘째, 전체 히스토리 컨디셔닝을 적용한 자유회귀 flow-matching 헤드로 장거리 일관성을 유지한다. 셋째, 리워드 없는 자기수정 포스트트레이닝으로 음향 품질을 향상시켰다. 150만 시간 음성 데이터로 학습하여 Seed-TTS-Eval에서 오픈소스 SOTA를 달성했고, MeanFlow 증류로 첫 패킷 지연시간 54ms를 달성했다.

핵심 요약

  • 48kHz 음성을 25Hz 128차원 잠재 공간으로 인코딩하는 고해상도 AudioVAE를 WavLM 정렬 손실과 함께 훈련하여 의미적 구조를 부여했다
  • 시맨틱 인코더, LLM, AR flow-matching 헤드의 3모듈 분리 구조로 장거리 오차 누적 문제를 완화했다
  • 리워드 모델 없이 flow-matching 헤드를 자체 추론 오류에 노출시키는 SOAR 자기수정 정렬을 도입했다
  • CFG-aware MeanFlow 증류로 NFE 2~4단계 추론을 가능하게 하여 RTF 0.231과 첫 패킷 지연 54ms를 H800에서 달성했다
  • Seed-TTS-Eval에서 WER 2.92, SIM 79.2로 오픈소스 SOTA를 기록하고 Apache 2.0으로 전체 공개했다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)