debpalash/VoiceStudio

出典
GitHub
初登場日
分野
メディア
GitHubスター数
44,111
主な言語
Python
ウェブサイト
voicestudio.sh (新しいタブで開きます)

外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

debpalash/VoiceStudio

何をするか

VoiceStudioはローカルで動くオープンソースのアプリで、音声クローン、音声デザイン、動画の吹き替え、音声入力、文字起こし、オーディオブック制作を646言語で扱えます。agent向けのローカルAPIとMCPも提供します。

ATFへの役立ち方

音声入力と文字起こしの機能は、ATF Worksの日次業務日誌を音声で残す方法の参考になり得ます。音声クローンと吹き替えの機能は私たちの製品の範囲外です。

ライセンス

AGPL-3.0 ネットワーク コピーレフトです。改変版をサービスとして提供する場合もソース公開が必要です。製品利用の前に確認が必要です。

同じ分野のリポジトリ

  • crmne/spotifast
    SpotifastはRustとeguiで書かれたネイティブのSpotifyクライアントで、librespotで音楽を再生し、Spotify Connectのデバイスとして表示されます。Linux、macOS、Windowsで動作し、再生にはSpotify Premiumが必要です。
  • LiamGvchi/gc-minimal-zine-poster
    GC Minimal Zine Posterは、テーマ、文、物、雰囲気、写真を、余白の多い紙の質感の編集ポスター、画像prompt、または再利用できるビジュアルシステムに変えるCodex skillです。
  • webadderallorg/Recordly
    デモや操作説明の動画向けに、画面を録画して編集するデスクトップアプリです。自動ズーム、滑らかなカーソルの動き、ウェブカメラのオーバーレイ、装飾フレーム、タイムライン編集を備えています。
  • huggingface/speech-to-speech
    音声区間検出、音声認識、言語モデル、音声合成を順につなぐモジュール型のvoice agent pipelineです。OpenAI RealtimeのイベントをWebSocketとWebRTCで提供し、ローカルで動かすLLMを含め、すべての構成要素を差し替えられます。
  • k2-fsa/OmniVoice
    600以上の言語に対応するzero-shotのTTS(text-to-speech)モデルです。音声クローン、性別、年齢、訛りなどの話者属性による声の設計、発音修正に対応し、Python APIとCLIを提供します。

Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。

GitHubで見る (新しいタブで開きます)