debpalash/VoiceStudio
- 出典
- GitHub
- 初登場日
- 分野
- メディア
- GitHubスター数
- 44,111
- 主な言語
- Python
外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

何をするか
VoiceStudioはローカルで動くオープンソースのアプリで、音声クローン、音声デザイン、動画の吹き替え、音声入力、文字起こし、オーディオブック制作を646言語で扱えます。agent向けのローカルAPIとMCPも提供します。
ATFへの役立ち方
音声入力と文字起こしの機能は、ATF Worksの日次業務日誌を音声で残す方法の参考になり得ます。音声クローンと吹き替えの機能は私たちの製品の範囲外です。
ライセンス
AGPL-3.0 ネットワーク コピーレフトです。改変版をサービスとして提供する場合もソース公開が必要です。製品利用の前に確認が必要です。
同じ分野のリポジトリ
- crmne/spotifast
SpotifastはRustとeguiで書かれたネイティブのSpotifyクライアントで、librespotで音楽を再生し、Spotify Connectのデバイスとして表示されます。Linux、macOS、Windowsで動作し、再生にはSpotify Premiumが必要です。 - LiamGvchi/gc-minimal-zine-poster
GC Minimal Zine Posterは、テーマ、文、物、雰囲気、写真を、余白の多い紙の質感の編集ポスター、画像prompt、または再利用できるビジュアルシステムに変えるCodex skillです。 - webadderallorg/Recordly
デモや操作説明の動画向けに、画面を録画して編集するデスクトップアプリです。自動ズーム、滑らかなカーソルの動き、ウェブカメラのオーバーレイ、装飾フレーム、タイムライン編集を備えています。 - huggingface/speech-to-speech
音声区間検出、音声認識、言語モデル、音声合成を順につなぐモジュール型のvoice agent pipelineです。OpenAI RealtimeのイベントをWebSocketとWebRTCで提供し、ローカルで動かすLLMを含め、すべての構成要素を差し替えられます。 - k2-fsa/OmniVoice
600以上の言語に対応するzero-shotのTTS(text-to-speech)モデルです。音声クローン、性別、年齢、訛りなどの話者属性による声の設計、発音修正に対応し、Python APIとCLIを提供します。
Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。