kyutai-labs/pocket-tts
- 出典
- GitHub
- 初登場日
- 分野
- メディア
- GitHubスター数
- 9,539
- 主な言語
- Python
外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

何をするか
GPUなしでCPU上で動く小さなTTS(text-to-speech)モデルで、音声ストリーミング、音声クローン、Python API、CLIを提供します。英語、フランス語、ドイツ語、ポルトガル語、イタリア語、スペイン語に対応し、ブラウザでも動かせます。
ATFへの役立ち方
私たちの製品との関連は弱いです。GPUのない一般的なPCで音声を出力する方法として、ATF Worksのようなワークスペースで文書を読み上げる場合の参考になり得ます。
ライセンス
MIT 寛容なライセンスです。著作権表示を残せば商用利用と改変ができます。
同じ分野のリポジトリ
- originalankur/maptoposter
都市のミニマルな地図ポスターを作成して書き出すPythonスクリプトです。blueprintやjapanese_inkなどのテーマを選べます。 - chatfire-AI/huobao-drama
ショートドラマ制作を自動化するフルスタックのプラットフォームです。LLMが脚本から人物、シーン、絵コンテを抽出し、画像と動画のモデルがデザインとクリップを作って1話の映像に合成します。 - torvalds/AudioNoise
AudioNoiseは、デジタル音声処理の基礎を学ぶために作られた、phaserやechoなどのシンプルな音声エフェクト集です。IIRフィルターとdelay loopを使い、1サンプルを受けて1サンプルを出す方式で処理します。 - cjpais/Handy
オフラインで動くクロスプラットフォームのデスクトップ音声認識アプリです。ショートカットを押し続けるか切り替えて話すと、書き起こした文章が使用中のアプリに貼り付けられます。無音はSilero VADで除き、書き起こしはローカルのWhisperまたはParakeetモデルで行います。 - remotion-dev/remotion
Reactのコードで動画を作るフレームワークで、コードが正本になります。コーディングエージェントで作る、ドラッグ&ドロップで編集する、データにつないで自前のインフラで一括レンダリングする、といった使い方ができます。
Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。