microsoft/VibeVoice
- 来源
- GitHub
- 首次上榜日期
- 领域
- 媒体
- GitHub 星标数
- 54,353
- 主要语言
- Python
本页介绍外部开源仓库,并非 HDATF 产品。

它做什么
VibeVoice是一个开源语音AI项目。其语音识别模型可一次处理60分钟的长音频,转写为标注说话人和时间戳的文本;流式版本则在语音输入的同时进行转写。
对 ATF 的帮助
由于转写结果会标明谁在何时发言,可作为在ATF Works中把会议录音转为工作记录的参考。
许可证
MIT 宽松许可。保留版权声明即可商用和修改。
同领域的其他仓库
- siddharthvaddem/openscreen
OpenScreen是用于制作产品演示和操作讲解视频的开源录屏工具,支持窗口或全屏录制、麦克风和系统音频、摄像头叠加画面、自动或手动缩放、光标效果以及在设备端生成字幕。该项目已归档。 - tiajinsha/JKVideo
JKVideo是用React Native开发的第三方Bilibili客户端,支持DASH视频播放、弹幕、直播和下载。项目收到Bilibili律师函后已停止维护。 - OpenBMB/VoxCPM
VoxCPM 是一款无需 tokenizer 的文本转语音(TTS)系统。VoxCPM2 为 2B 参数模型,支持 30 种语言、根据文字描述设计声音、基于短音频进行可控的声音克隆,以及 48kHz 音频输出。 - hacksider/Deep-Live-Cam
Deep-Live-Cam是只用一张图片即可实时换脸并制作视频deepfake的工具。它内置检查功能,用于阻止裸露或血腥画面等不当媒体。 - heygen-com/hyperframes
HyperFrames把HTML、CSS、媒体和可跳转到任意时间点的动画转换成结果确定的MP4视频。既可以通过CLI使用,也可以通过涵盖规划、编写HTML、lint、预览和渲染流程的skill,供AI coding agent使用。
只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。