huggingface/speech-to-speech
- 来源
- GitHub
- 首次上榜日期
- 领域
- 媒体
- GitHub 星标数
- 13,250
- 主要语言
- Python
本页介绍外部开源仓库,并非 HDATF 产品。

它做什么
一个模块化的voice agent pipeline,依次连接语音活动检测、语音识别、语言模型和语音合成。它通过WebSocket和WebRTC提供OpenAI Realtime事件,所有组件都可替换,包括本地运行的LLM。
对 ATF 的帮助
关联度较低。如果考虑为ATF Works中的AI助手加入语音输入,其语音与语言模型各环节可替换或在本地运行的结构可作为参考。
许可证
Apache-2.0 宽松许可,含专利授权。可商用,需保留声明并注明修改。
同领域的其他仓库
- LiamGvchi/gc-minimal-zine-poster
GC Minimal Zine Poster是一个Codex skill,可把主题、句子、物件、氛围或照片转成留白很多的纸张质感编辑风海报、图像prompt或可复用的视觉体系。 - img2threejs/img2threejs
将参考图片中的物体重建为纯代码的程序化Three.js模型,不使用摄影测量、网格提取或下载的素材包。模型经过质量把关,可直接用于动画。 - debpalash/VoiceStudio
VoiceStudio是一款在本地运行的开源应用,支持646种语言的声音克隆、声音设计、视频配音、听写、转录和有声书制作。它还为agent提供本地API和MCP。 - bradautomates/claude-video
一个skill,让Claude能针对URL或本地路径中的视频回答问题。它使用字幕,没有字幕时改用Whisper生成带时间戳的转写,并抽取画面帧作为图片交给Claude。 - crmne/spotifast
Spotifast是用Rust和egui编写的原生Spotify客户端,通过librespot播放音乐,并显示为Spotify Connect设备。它可在Linux、macOS和Windows上运行,播放需要Spotify Premium。
只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。