debpalash/VoiceStudio

来源
GitHub
首次上榜日期
领域
媒体
GitHub 星标数
44,111
主要语言
Python
网站
voicestudio.sh (在新标签页中打开)

本页介绍外部开源仓库,并非 HDATF 产品。

debpalash/VoiceStudio

它做什么

VoiceStudio是一款在本地运行的开源应用,支持646种语言的声音克隆、声音设计、视频配音、听写、转录和有声书制作。它还为agent提供本地API和MCP。

对 ATF 的帮助

其听写和转录功能可作为在ATF Works中用语音记录每日工作日志的参考。声音克隆和配音功能不在我们产品的范围内。

许可证

AGPL-3.0 网络 Copyleft 许可。以服务形式提供修改版也须公开源码。用于产品前需要评估。

同领域的其他仓库

  • crmne/spotifast
    Spotifast是用Rust和egui编写的原生Spotify客户端,通过librespot播放音乐,并显示为Spotify Connect设备。它可在Linux、macOS和Windows上运行,播放需要Spotify Premium。
  • LiamGvchi/gc-minimal-zine-poster
    GC Minimal Zine Poster是一个Codex skill,可把主题、句子、物件、氛围或照片转成留白很多的纸张质感编辑风海报、图像prompt或可复用的视觉体系。
  • webadderallorg/Recordly
    一款用于录制和编辑屏幕画面的桌面应用,面向演示和操作讲解视频,提供自动缩放、平滑光标移动、摄像头悬浮窗、美化画框和时间线编辑。
  • huggingface/speech-to-speech
    一个模块化的voice agent pipeline,依次连接语音活动检测、语音识别、语言模型和语音合成。它通过WebSocket和WebRTC提供OpenAI Realtime事件,所有组件都可替换,包括本地运行的LLM。
  • k2-fsa/OmniVoice
    一个支持600多种语言的zero-shot TTS(文本转语音)模型。支持声音克隆、按性别、年龄、口音等说话人属性设计声音以及发音纠正,并提供Python API和命令行工具。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)