run-llama/liteparse
- 来源
- GitHub
- 首次上榜日期
- 领域
- 文档
- GitHub 星标数
- 12,317
- 主要语言
- Rust
本页介绍外部开源仓库,并非 HDATF 产品。

它做什么
一个在本地运行的PDF解析器,不依赖云服务或LLM功能,可提取带有空间位置和边界框的文本。它内置Tesseract OCR,可以调用外部OCR服务器,并能判断文档是否需要更重的解析。
对 ATF 的帮助
可作为Company Brain读取PDF资料、以及LabChin从检索到的资料中提取文本的参考。它判断哪些文档需要OCR的功能,在扫描件与电子文档混杂的情况下值得比较。
许可证
Apache-2.0 宽松许可,含专利授权。可商用,需保留声明并注明修改。
同领域的其他仓库
- opendatalab/MinerU
将PDF、Office文件、扫描文档图片等转换为可用于LLM和agent工作流的Markdown或JSON。4.0版本把解析、本地文档库和服务工具整合为一个流程,并按从快速预览到复杂版面分设多个解析档位。 - docusealco/docuseal
这是一款开源、可自托管的工具,用于创建可在线填写和签署的PDF表单。它提供WYSIWYG字段编辑器、单个文档多位提交人、PDF签名验证,以及API和webhook。 - baidu/Unlimited-OCR
一个以one-shot long-horizon parsing为目标的OCR模型,旨在把DeepSeek-OCR再向前推进一步。可在NVIDIA GPU上用Hugging Face Transformers或用vLLM推理,并支持用ms-swift训练。 - iamgio/quarkdown
Quarkdown为Markdown加入函数、变量,以及包含布局、数学、条件语句和循环的标准库。一个项目可以编译成书籍、学术论文、知识库、演示文稿或网站。 - langchain-ai/openwiki
OpenWiki是一个CLI,由agent读取代码库或个人资料,写出相互链接的Markdown wiki,并在每次变更时保持更新。它还会把关键事实追溯到带版本的原始依据。
只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。