NVIDIA/personaplex

来源
GitHub
首次上榜日期
领域
媒体
GitHub 星标数
10,546
主要语言
Python

本页介绍外部开源仓库,并非 HDATF 产品。

NVIDIA/personaplex

它做什么

PersonaPlex 是一个实时 full-duplex 语音对语音对话模型。它通过文本角色 prompt 设定 persona,并用音频样本调节声音。该模型基于 Moshi 的架构和权重。

对 ATF 的帮助

与我们的产品无关,因进入排行榜而一并收录。

许可证

MIT 宽松许可。保留版权声明即可商用和修改。

同领域的其他仓库

  • QwenLM/Qwen3-TTS
    阿里云Qwen团队开源的TTS语音合成模型系列。支持流式语音生成、自由声音设计、声音克隆以及通过自然语言控制语音。
  • remotion-dev/remotion
    一个用React代码制作视频的框架,以代码为准。可以借助编码智能体制作视频、通过拖放编辑,或连接数据后在自己的基础设施上批量渲染。
  • ace-step/ACE-Step-1.5
    ACE-Step 1.5是一个可在Mac、AMD、Intel和CUDA设备上本地运行的开源音乐生成模型。用户可以用几首歌曲训练LoRA,以体现自己的风格。
  • torvalds/AudioNoise
    AudioNoise是为学习数字音频处理基础而写的一组简单音频效果,例如phaser和echo。它使用IIR滤波器和delay loop,按输入一个样本、输出一个样本的方式处理。
  • dwzhu-pku/PaperBanana
    这是一个利用VLM和图像生成模型为学术论文制作插图的工具,提供可选择模型的Streamlit界面。它是从Google Research的PaperVizAgent fork而来的项目。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)