huggingface/speech-to-speech

来源
GitHub
首次上榜日期
领域
媒体
GitHub 星标数
13,250
主要语言
Python

本页介绍外部开源仓库,并非 HDATF 产品。

huggingface/speech-to-speech

它做什么

一个模块化的voice agent pipeline,依次连接语音活动检测、语音识别、语言模型和语音合成。它通过WebSocket和WebRTC提供OpenAI Realtime事件,所有组件都可替换,包括本地运行的LLM。

对 ATF 的帮助

关联度较低。如果考虑为ATF Works中的AI助手加入语音输入,其语音与语言模型各环节可替换或在本地运行的结构可作为参考。

许可证

Apache-2.0 宽松许可,含专利授权。可商用,需保留声明并注明修改。

同领域的其他仓库

  • LiamGvchi/gc-minimal-zine-poster
    GC Minimal Zine Poster是一个Codex skill,可把主题、句子、物件、氛围或照片转成留白很多的纸张质感编辑风海报、图像prompt或可复用的视觉体系。
  • img2threejs/img2threejs
    将参考图片中的物体重建为纯代码的程序化Three.js模型,不使用摄影测量、网格提取或下载的素材包。模型经过质量把关,可直接用于动画。
  • debpalash/VoiceStudio
    VoiceStudio是一款在本地运行的开源应用,支持646种语言的声音克隆、声音设计、视频配音、听写、转录和有声书制作。它还为agent提供本地API和MCP。
  • bradautomates/claude-video
    一个skill,让Claude能针对URL或本地路径中的视频回答问题。它使用字幕,没有字幕时改用Whisper生成带时间戳的转写,并抽取画面帧作为图片交给Claude。
  • crmne/spotifast
    Spotifast是用Rust和egui编写的原生Spotify客户端,通过librespot播放音乐,并显示为Spotify Connect设备。它可在Linux、macOS和Windows上运行,播放需要Spotify Premium。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)