dwzhu-pku/PaperBanana
- 来源
- GitHub
- 首次上榜日期
- 领域
- 媒体
- GitHub 星标数
- 7,093
- 主要语言
- Python
本页介绍外部开源仓库,并非 HDATF 产品。
它做什么
这是一个利用VLM和图像生成模型为学术论文制作插图的工具,提供可选择模型的Streamlit界面。它是从Google Research的PaperVizAgent fork而来的项目。
对 ATF 的帮助
当LabChin的最终研究报告需要配图时,可以作为参考。其分别选择主模型和图像模型的做法也值得比较。
许可证
Apache-2.0 宽松许可,含专利授权。可商用,需保留声明并注明修改。
同领域的其他仓库
- jamiepine/voicebox
一款本地AI语音工作室,可用简短音频样本克隆声音,用多种TTS引擎生成语音,并通过快捷键在任意文本框中听写输入。它还可以为支持MCP的AI agent提供声音。 - ace-step/ACE-Step-1.5
ACE-Step 1.5是一个可在Mac、AMD、Intel和CUDA设备上本地运行的开源音乐生成模型。用户可以用几首歌曲训练LoRA,以体现自己的风格。 - waooAI/waoowaoo
用于制作图片和视频的AI工作空间。用户与助手一起完善创意简报,上传参考素材,在画布上生成和修改结果;将结果修改为新版本时会保留原版本。 - QwenLM/Qwen3-TTS
阿里云Qwen团队开源的TTS语音合成模型系列。支持流式语音生成、自由声音设计、声音克隆以及通过自然语言控制语音。 - nikopueringer/CorridorKey
CorridorKey 是用于绿幕抠像的神经网络。它从原始绿幕画面中,为每个像素预测前景颜色和干净的线性 alpha 通道,包括半透明边缘和运动模糊。
只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。