StepAudio 2.5 Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 227
- 분야
- Research
- arXiv 번호
- 2605.23463
StepFun-Audio 팀은 자동 음성 인식(ASR), 텍스트 음성 변환(TTS), 실시간 음성 상호작용 전반에서 특화 시스템의 성능에 필적하거나 이를 능가하는 통합 오디오-언어 기반 모델 StepAudio 2.5를 선보인다.
StepAudio 2.5는 음성 인식, 음성 합성, 실시간 음성 대화를 하나의 오디오-언어 기반 모델에서 처리하는 통합 시스템이다. 텍스트와 오디오의 공통 표현을 학습한 공유 백본에 과제별 데이터, 목적 함수, 디코딩 제약과 RLHF를 적용해 세 가지 운용 모드를 만든다. 음성 인식에는 검증 가능한 다중 토큰 디코딩을, 음성 합성에는 선호 기반 RLHF를, 실시간 대화에는 생성형 보상 모델을 사용한다. 평가에서 중국어 평균 글자 오류율 2.97%와 영어 평균 단어 오류율 3.68%를 기록했고, 32K 문맥으로 긴 음성에서도 강한 인식 성능을 보였다. 보고서는 특화 모델과 경쟁하는 결과를 제시하며, 하나의 백본도 서로 다른 최적화와 배포 방식을 통해 이해와 생성 및 실시간 상호작용을 모두 수행할 수 있음을 보여준다.
핵심 요약
- ASR 정확도: 모델은 중국어 벤치마크에서 평균 글자 오류율(CER) 2.97%를, 영어 벤치마크에서 단어 오류율(WER) 3.68%를 달성했다. 32K 컨텍스트 윈도우 덕분에 장형 오디오에서의 성능이 특히 강력하다.
- 디코딩 효율: MTP-5 메커니즘 덕분에 모델은 실시간 계수(RTF) 0.0053을 달성하여 여러 특화 ASR 시스템보다 빠르다. MTP 토큰의 수용률은 약 0.9의 일관된 감쇠 계수를 보여, 다섯 개의 선행 분기를 선택한 것이 타당함을 입증했다.
- TTS 선호도: 아레나 방식 평가에서 StepAudio 2.5 TTS는 ElevenLabs와 Gemini Flash TTS 같은 기존 경쟁자들을 상대로 전체 승률 67.6%를 달성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.