dwzhu-pku/PaperBanana

出典
GitHub
初登場日
分野
メディア
GitHubスター数
7,093
主な言語
Python
ウェブサイト
dwzhu-pku.github.io/PaperBanana (新しいタブで開きます)

外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

dwzhu-pku/PaperBanana

何をするか

VLMと画像生成モデルを使って学術論文用の図を作るツールです。Streamlitの画面で使うモデルを選べます。Google ResearchのPaperVizAgentをforkしたプロジェクトです。

ATFへの役立ち方

LabChinで最終研究レポートに図が必要な場合の参考になり得ます。メインモデルと画像モデルを別々に選ぶ構成も比較する価値があります。

ライセンス

Apache-2.0 寛容で特許許諾を含みます。商用利用できます。告知を残し、変更点を明記します。

同じ分野のリポジトリ

  • jamiepine/voicebox
    短い音声サンプルから声を複製し、複数のTTSエンジンで音声を生成し、ホットキーで任意の入力欄に音声入力できるローカルのAI音声スタジオです。MCP対応のAI agentに声を与えることもできます。
  • ace-step/ACE-Step-1.5
    ACE-Step 1.5は、Mac、AMD、Intel、CUDAデバイスでローカルに動くオープンソースの音楽生成モデルです。数曲からLoRAを学習させ、自分のスタイルを反映できます。
  • waooAI/waoowaoo
    画像と動画を作るAIワークスペースです。アシスタントと一緒にブリーフを練り、参考資料をアップロードし、キャンバス上で生成と修正を行います。結果を新しいバージョンに修正しても元の結果は残ります。
  • QwenLM/Qwen3-TTS
    Alibaba CloudのQwenチームによるオープンソースの音声合成(TTS)モデルシリーズです。ストリーミング音声生成、自由な声のデザイン、声のクローン、自然言語による音声の制御に対応します。
  • nikopueringer/CorridorKey
    CorridorKeyは、グリーンバックのキーイングを行うニューラルネットワークです。元のグリーンバック映像のフレームから、半透明の縁やモーションブラーも含めて、ピクセルごとに前景の色ときれいなリニアアルファチャンネルを推定します。

Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。

GitHubで見る (新しいタブで開きます)