QwenLM/Qwen3-TTS
- 出典
- GitHub
- 初登場日
- 分野
- メディア
- GitHubスター数
- 13,419
- 主な言語
- Python
外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

何をするか
Alibaba CloudのQwenチームによるオープンソースの音声合成(TTS)モデルシリーズです。ストリーミング音声生成、自由な声のデザイン、声のクローン、自然言語による音声の制御に対応します。
ATFへの役立ち方
関連は緩やかです。ATF WorksのAIアシスタントが回答を読み上げる場合、セルフホスト型の音声出力の参考になり得ます。
ライセンス
Apache-2.0 寛容で特許許諾を含みます。商用利用できます。告知を残し、変更点を明記します。
同じ分野のリポジトリ
- ace-step/ACE-Step-1.5
ACE-Step 1.5は、Mac、AMD、Intel、CUDAデバイスでローカルに動くオープンソースの音楽生成モデルです。数曲からLoRAを学習させ、自分のスタイルを反映できます。 - NVIDIA/personaplex
PersonaPlexは、リアルタイムで聞きながら話せるfull-duplexの音声対話モデルです。テキストの役割promptでペルソナを決め、音声サンプルで声を調整します。Moshiのアーキテクチャと重みをベースにしています。 - dwzhu-pku/PaperBanana
VLMと画像生成モデルを使って学術論文用の図を作るツールです。Streamlitの画面で使うモデルを選べます。Google ResearchのPaperVizAgentをforkしたプロジェクトです。 - remotion-dev/remotion
Reactのコードで動画を作るフレームワークで、コードが正本になります。コーディングエージェントで作る、ドラッグ&ドロップで編集する、データにつないで自前のインフラで一括レンダリングする、といった使い方ができます。 - jamiepine/voicebox
短い音声サンプルから声を複製し、複数のTTSエンジンで音声を生成し、ホットキーで任意の入力欄に音声入力できるローカルのAI音声スタジオです。MCP対応のAI agentに声を与えることもできます。
Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。