huggingface/speech-to-speech

出典
GitHub
初登場日
分野
メディア
GitHubスター数
13,250
主な言語
Python

外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

huggingface/speech-to-speech

何をするか

音声区間検出、音声認識、言語モデル、音声合成を順につなぐモジュール型のvoice agent pipelineです。OpenAI RealtimeのイベントをWebSocketとWebRTCで提供し、ローカルで動かすLLMを含め、すべての構成要素を差し替えられます。

ATFへの役立ち方

関連は薄いです。ATF WorksのAIアシスタントで音声入力を検討する場合、音声と言語モデルの各段階を差し替えたりローカルで動かしたりする構成の参考になり得ます。

ライセンス

Apache-2.0 寛容で特許許諾を含みます。商用利用できます。告知を残し、変更点を明記します。

同じ分野のリポジトリ

  • LiamGvchi/gc-minimal-zine-poster
    GC Minimal Zine Posterは、テーマ、文、物、雰囲気、写真を、余白の多い紙の質感の編集ポスター、画像prompt、または再利用できるビジュアルシステムに変えるCodex skillです。
  • img2threejs/img2threejs
    参照画像に写った物体を、コードだけで作るプロシージャルなThree.jsモデルとして再構築します。フォトグラメトリ、メッシュ抽出、ダウンロードした素材は使わず、品質チェックを通したアニメーション対応のモデルになります。
  • debpalash/VoiceStudio
    VoiceStudioはローカルで動くオープンソースのアプリで、音声クローン、音声デザイン、動画の吹き替え、音声入力、文字起こし、オーディオブック制作を646言語で扱えます。agent向けのローカルAPIとMCPも提供します。
  • bradautomates/claude-video
    URLやローカルパスの動画について、Claudeが質問に答えられるようにするskillです。字幕を使い、字幕がなければWhisperでタイムスタンプ付きの文字起こしを作り、フレームを抽出して画像としてClaudeに渡します。
  • crmne/spotifast
    SpotifastはRustとeguiで書かれたネイティブのSpotifyクライアントで、librespotで音楽を再生し、Spotify Connectのデバイスとして表示されます。Linux、macOS、Windowsで動作し、再生にはSpotify Premiumが必要です。

Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。

GitHubで見る (新しいタブで開きます)