microsoft/VibeVoice
- 出典
- GitHub
- 初登場日
- 分野
- メディア
- GitHubスター数
- 54,353
- 主な言語
- Python
外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

何をするか
VibeVoiceはオープンソースの音声AIプロジェクトです。音声認識モデルは60分の長い音声を一度に処理し、話者とタイムスタンプ付きのテキストに書き起こします。ストリーミング版は話している最中から書き起こします。
ATFへの役立ち方
書き起こしに誰がいつ話したかが記されるため、ATF Worksで会議の録音を業務記録に変える際の参考になり得ます。
ライセンス
MIT 寛容なライセンスです。著作権表示を残せば商用利用と改変ができます。
同じ分野のリポジトリ
- siddharthvaddem/openscreen
OpenScreenは、製品デモや操作説明の動画を作るためのオープンソースの画面録画ツールです。ウィンドウまたは全画面の録画、マイクとシステム音声、Webカメラのオーバーレイ、自動または手動のズーム、カーソル効果、端末上での字幕生成に対応します。現在はアーカイブされています。 - tiajinsha/JKVideo
JKVideoはReact Nativeで作られたサードパーティ製のBilibiliクライアントで、DASH動画再生、弾幕、ライブ配信、ダウンロードに対応しています。Bilibiliから弁護士書簡を受け取った後、メンテナンスを停止しました。 - OpenBMB/VoxCPM
VoxCPMは、tokenizerを使わない音声合成(TTS)システムです。VoxCPM2は2Bパラメータのモデルで、30言語、テキストの説明による声の設計、短い音声からの調整可能な声のクローン、48kHzの音声出力に対応します。 - hacksider/Deep-Live-Cam
Deep-Live-Camは、1枚の画像からリアルタイムの顔の入れ替えや動画のdeepfakeを作るツールです。ヌードや過激な映像などの不適切なメディアを防ぐためのチェック機能が組み込まれています。 - heygen-com/hyperframes
HyperFramesは、HTML、CSS、メディア、任意の時点にシークできるアニメーションを、常に同じ結果になるMP4動画に変換します。CLIから使うことも、企画、HTML作成、lint、プレビュー、レンダリングの流れをまとめたskillを通じてAI coding agentから使うこともできます。
Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。