kyutai-labs/pocket-tts

出典
GitHub
初登場日
分野
メディア
GitHubスター数
9,539
主な言語
Python

外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

kyutai-labs/pocket-tts

何をするか

GPUなしでCPU上で動く小さなTTS(text-to-speech)モデルで、音声ストリーミング、音声クローン、Python API、CLIを提供します。英語、フランス語、ドイツ語、ポルトガル語、イタリア語、スペイン語に対応し、ブラウザでも動かせます。

ATFへの役立ち方

私たちの製品との関連は弱いです。GPUのない一般的なPCで音声を出力する方法として、ATF Worksのようなワークスペースで文書を読み上げる場合の参考になり得ます。

ライセンス

MIT 寛容なライセンスです。著作権表示を残せば商用利用と改変ができます。

同じ分野のリポジトリ

  • originalankur/maptoposter
    都市のミニマルな地図ポスターを作成して書き出すPythonスクリプトです。blueprintやjapanese_inkなどのテーマを選べます。
  • chatfire-AI/huobao-drama
    ショートドラマ制作を自動化するフルスタックのプラットフォームです。LLMが脚本から人物、シーン、絵コンテを抽出し、画像と動画のモデルがデザインとクリップを作って1話の映像に合成します。
  • torvalds/AudioNoise
    AudioNoiseは、デジタル音声処理の基礎を学ぶために作られた、phaserやechoなどのシンプルな音声エフェクト集です。IIRフィルターとdelay loopを使い、1サンプルを受けて1サンプルを出す方式で処理します。
  • cjpais/Handy
    オフラインで動くクロスプラットフォームのデスクトップ音声認識アプリです。ショートカットを押し続けるか切り替えて話すと、書き起こした文章が使用中のアプリに貼り付けられます。無音はSilero VADで除き、書き起こしはローカルのWhisperまたはParakeetモデルで行います。
  • remotion-dev/remotion
    Reactのコードで動画を作るフレームワークで、コードが正本になります。コーディングエージェントで作る、ドラッグ&ドロップで編集する、データにつないで自前のインフラで一括レンダリングする、といった使い方ができます。

Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。

GitHubで見る (新しいタブで開きます)