baidu/Unlimited-OCR

出典
GitHub
初登場日
分野
ドキュメント
GitHubスター数
25,740
主な言語
Python

外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

baidu/Unlimited-OCR

何をするか

one-shot long-horizon parsingを目指すOCRモデルで、DeepSeek-OCRをさらに一歩進めようとしています。NVIDIA GPU上のHugging Face Transformers、またはvLLMで推論でき、ms-swiftで学習もできます。

ATFへの役立ち方

スキャンした社内文書や論文を、Company BrainやLabChinで検索できるテキストに変換するOCR工程として比較する価値があります。

ライセンス

MIT 寛容なライセンスです。著作権表示を残せば商用利用と改変ができます。

同じ分野のリポジトリ

  • langchain-ai/openwiki
    OpenWikiは、agentがコードベースや個人の資料を読み、相互にリンクしたMarkdownのwikiを書いて、変更のたびに最新の状態に保つCLIです。主要な事実をバージョン付きの元資料の根拠にひもづけて追跡します。
  • opendatalab/MinerU
    PDF、Officeファイル、スキャンした文書画像などを、LLMやagentのworkflowで使えるMarkdownまたはJSONに変換します。バージョン4.0では解析、ローカル文書ライブラリ、サービスツールを一つの流れにまとめ、高速なプレビューから複雑なレイアウトまで解析レベルを段階的に用意しています。
  • iOfficeAI/OfficeCLI
    AI agentがOfficeをインストールせずにWord、Excel、PowerPointファイルを読み、編集し、自動化できる単一バイナリのCLIツールです。.docx、.xlsx、.pptxをHTMLやPNGにレンダリングし、agentが結果を確認して修正できるようにします。
  • run-llama/liteparse
    クラウドサービスやLLM機能を使わず、ローカルでPDFのテキストを位置情報とバウンディングボックス付きで抽出するパーサーです。Tesseract OCRを同梱し、外部のOCRサーバーも呼び出せ、文書により重い解析が必要かを判定します。
  • chuspeeism/dashi-ppt-skill
    文書をWebプレゼンテーションに変換するagent skillで、12種類のビジュアルテーマがあります。各ページにはブラウザ上で文字、レイアウト、メディアを編集するコントロールがあり、HTML、PDF、編集可能なPPTXに書き出せます。

Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。

GitHubで見る (新しいタブで開きます)