QwenLM/Qwen3-TTS

来源
GitHub
首次上榜日期
领域
媒体
GitHub 星标数
13,419
主要语言
Python

本页介绍外部开源仓库,并非 HDATF 产品。

QwenLM/Qwen3-TTS

它做什么

阿里云Qwen团队开源的TTS语音合成模型系列。支持流式语音生成、自由声音设计、声音克隆以及通过自然语言控制语音。

对 ATF 的帮助

关联较弱。如果ATF Works的AI助手需要朗读回答,可作为自托管语音输出的参考。

许可证

Apache-2.0 宽松许可,含专利授权。可商用,需保留声明并注明修改。

同领域的其他仓库

  • ace-step/ACE-Step-1.5
    ACE-Step 1.5是一个可在Mac、AMD、Intel和CUDA设备上本地运行的开源音乐生成模型。用户可以用几首歌曲训练LoRA,以体现自己的风格。
  • NVIDIA/personaplex
    PersonaPlex 是一个实时 full-duplex 语音对语音对话模型。它通过文本角色 prompt 设定 persona,并用音频样本调节声音。该模型基于 Moshi 的架构和权重。
  • dwzhu-pku/PaperBanana
    这是一个利用VLM和图像生成模型为学术论文制作插图的工具,提供可选择模型的Streamlit界面。它是从Google Research的PaperVizAgent fork而来的项目。
  • remotion-dev/remotion
    一个用React代码制作视频的框架,以代码为准。可以借助编码智能体制作视频、通过拖放编辑,或连接数据后在自己的基础设施上批量渲染。
  • jamiepine/voicebox
    一款本地AI语音工作室,可用简短音频样本克隆声音,用多种TTS引擎生成语音,并通过快捷键在任意文本框中听写输入。它还可以为支持MCP的AI agent提供声音。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)