run-llama/liteparse

出典
GitHub
初登場日
分野
ドキュメント
GitHubスター数
12,317
主な言語
Rust
ウェブサイト
developers.llamaindex.ai/liteparse (新しいタブで開きます)

外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

run-llama/liteparse

何をするか

クラウドサービスやLLM機能を使わず、ローカルでPDFのテキストを位置情報とバウンディングボックス付きで抽出するパーサーです。Tesseract OCRを同梱し、外部のOCRサーバーも呼び出せ、文書により重い解析が必要かを判定します。

ATFへの役立ち方

Company BrainがPDF資料を読み込む方法や、LabChinが検索した資料からテキストを取り出す処理の参考になります。どの文書にOCRが必要かを見分ける機能は、スキャン文書とデジタル文書が混在する場合に比較する価値があります。

ライセンス

Apache-2.0 寛容で特許許諾を含みます。商用利用できます。告知を残し、変更点を明記します。

同じ分野のリポジトリ

  • opendatalab/MinerU
    PDF、Officeファイル、スキャンした文書画像などを、LLMやagentのworkflowで使えるMarkdownまたはJSONに変換します。バージョン4.0では解析、ローカル文書ライブラリ、サービスツールを一つの流れにまとめ、高速なプレビューから複雑なレイアウトまで解析レベルを段階的に用意しています。
  • docusealco/docuseal
    オンラインで記入と署名ができるPDFフォームを作る、オープンソースのself-hostedツールです。WYSIWYGのフィールド編集機能、1つの文書への複数の提出者、PDF署名の検証、APIとwebhookに対応しています。
  • baidu/Unlimited-OCR
    one-shot long-horizon parsingを目指すOCRモデルで、DeepSeek-OCRをさらに一歩進めようとしています。NVIDIA GPU上のHugging Face Transformers、またはvLLMで推論でき、ms-swiftで学習もできます。
  • iamgio/quarkdown
    QuarkdownはMarkdownに、関数、変数、そしてレイアウト、数学、条件分岐、ループを備えた標準ライブラリを加えます。1つのプロジェクトを、書籍、学術論文、ナレッジベース、プレゼンテーション、Webサイトにコンパイルできます。
  • langchain-ai/openwiki
    OpenWikiは、agentがコードベースや個人の資料を読み、相互にリンクしたMarkdownのwikiを書いて、変更のたびに最新の状態に保つCLIです。主要な事実をバージョン付きの元資料の根拠にひもづけて追跡します。

Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。

GitHubで見る (新しいタブで開きます)