dwzhu-pku/PaperBanana

来源
GitHub
首次上榜日期
领域
媒体
GitHub 星标数
7,093
主要语言
Python
网站
dwzhu-pku.github.io/PaperBanana (在新标签页中打开)

本页介绍外部开源仓库,并非 HDATF 产品。

dwzhu-pku/PaperBanana

它做什么

这是一个利用VLM和图像生成模型为学术论文制作插图的工具,提供可选择模型的Streamlit界面。它是从Google Research的PaperVizAgent fork而来的项目。

对 ATF 的帮助

当LabChin的最终研究报告需要配图时,可以作为参考。其分别选择主模型和图像模型的做法也值得比较。

许可证

Apache-2.0 宽松许可,含专利授权。可商用,需保留声明并注明修改。

同领域的其他仓库

  • jamiepine/voicebox
    一款本地AI语音工作室,可用简短音频样本克隆声音,用多种TTS引擎生成语音,并通过快捷键在任意文本框中听写输入。它还可以为支持MCP的AI agent提供声音。
  • ace-step/ACE-Step-1.5
    ACE-Step 1.5是一个可在Mac、AMD、Intel和CUDA设备上本地运行的开源音乐生成模型。用户可以用几首歌曲训练LoRA,以体现自己的风格。
  • waooAI/waoowaoo
    用于制作图片和视频的AI工作空间。用户与助手一起完善创意简报,上传参考素材,在画布上生成和修改结果;将结果修改为新版本时会保留原版本。
  • QwenLM/Qwen3-TTS
    阿里云Qwen团队开源的TTS语音合成模型系列。支持流式语音生成、自由声音设计、声音克隆以及通过自然语言控制语音。
  • nikopueringer/CorridorKey
    CorridorKey 是用于绿幕抠像的神经网络。它从原始绿幕画面中,为每个像素预测前景颜色和干净的线性 alpha 通道,包括半透明边缘和运动模糊。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)