baidu/Unlimited-OCR
- 来源
- GitHub
- 首次上榜日期
- 领域
- 文档
- GitHub 星标数
- 25,740
- 主要语言
- Python
本页介绍外部开源仓库,并非 HDATF 产品。

它做什么
一个以one-shot long-horizon parsing为目标的OCR模型,旨在把DeepSeek-OCR再向前推进一步。可在NVIDIA GPU上用Hugging Face Transformers或用vLLM推理,并支持用ms-swift训练。
对 ATF 的帮助
值得作为OCR环节进行比较,用于把扫描的公司文档和论文转成Company Brain或LabChin可检索的文本。
许可证
MIT 宽松许可。保留版权声明即可商用和修改。
同领域的其他仓库
- langchain-ai/openwiki
OpenWiki是一个CLI,由agent读取代码库或个人资料,写出相互链接的Markdown wiki,并在每次变更时保持更新。它还会把关键事实追溯到带版本的原始依据。 - opendatalab/MinerU
将PDF、Office文件、扫描文档图片等转换为可用于LLM和agent工作流的Markdown或JSON。4.0版本把解析、本地文档库和服务工具整合为一个流程,并按从快速预览到复杂版面分设多个解析档位。 - iOfficeAI/OfficeCLI
一个单文件二进制CLI工具,让AI agent无需安装Office即可读取、编辑和自动化处理Word、Excel和PowerPoint文件。它可将.docx、.xlsx、.pptx渲染为HTML或PNG,便于agent检查并修正输出。 - run-llama/liteparse
一个在本地运行的PDF解析器,不依赖云服务或LLM功能,可提取带有空间位置和边界框的文本。它内置Tesseract OCR,可以调用外部OCR服务器,并能判断文档是否需要更重的解析。 - chuspeeism/dashi-ppt-skill
一个把文档转换为网页演示文稿的agent skill,提供12套视觉主题。每页都带有在浏览器中编辑文字、版式和媒体的控件,结果可导出为HTML、PDF或可编辑的PPTX。
只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。