baidu/Unlimited-OCR

来源
GitHub
首次上榜日期
领域
文档
GitHub 星标数
25,740
主要语言
Python

本页介绍外部开源仓库,并非 HDATF 产品。

baidu/Unlimited-OCR

它做什么

一个以one-shot long-horizon parsing为目标的OCR模型,旨在把DeepSeek-OCR再向前推进一步。可在NVIDIA GPU上用Hugging Face Transformers或用vLLM推理,并支持用ms-swift训练。

对 ATF 的帮助

值得作为OCR环节进行比较,用于把扫描的公司文档和论文转成Company Brain或LabChin可检索的文本。

许可证

MIT 宽松许可。保留版权声明即可商用和修改。

同领域的其他仓库

  • langchain-ai/openwiki
    OpenWiki是一个CLI,由agent读取代码库或个人资料,写出相互链接的Markdown wiki,并在每次变更时保持更新。它还会把关键事实追溯到带版本的原始依据。
  • opendatalab/MinerU
    将PDF、Office文件、扫描文档图片等转换为可用于LLM和agent工作流的Markdown或JSON。4.0版本把解析、本地文档库和服务工具整合为一个流程,并按从快速预览到复杂版面分设多个解析档位。
  • iOfficeAI/OfficeCLI
    一个单文件二进制CLI工具,让AI agent无需安装Office即可读取、编辑和自动化处理Word、Excel和PowerPoint文件。它可将.docx、.xlsx、.pptx渲染为HTML或PNG,便于agent检查并修正输出。
  • run-llama/liteparse
    一个在本地运行的PDF解析器,不依赖云服务或LLM功能,可提取带有空间位置和边界框的文本。它内置Tesseract OCR,可以调用外部OCR服务器,并能判断文档是否需要更重的解析。
  • chuspeeism/dashi-ppt-skill
    一个把文档转换为网页演示文稿的agent skill,提供12套视觉主题。每页都带有在浏览器中编辑文字、版式和媒体的控件,结果可导出为HTML、PDF或可编辑的PPTX。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)