yifanfeng97/Hyper-Extract

来源
GitHub
首次上榜日期
领域
RAG 与检索
GitHub 星标数
4,068
主要语言
Python
网站
yifanfeng97.github.io/Hyper-Extract (在新标签页中打开)

本页介绍外部开源仓库,并非 HDATF 产品。

yifanfeng97/Hyper-Extract

它做什么

Hyper-Extract是一个从文档中抽取事实和关系、并转换为知识图谱等结构化数据的Python库,同时提供he CLI和he-mcp服务器。它面向希望把分散的文档整理成可用于检索和问答的知识数据的开发者和分析人员。它可直接读取txt和md文件,加装基于markitdown的可选安装项后还能读取PDF、DOCX、PPTX和XLSX。结果以列表、集合、图、超图、时间图、空间图、时空图和文档集合等结构保存,并可导出为Obsidian、GraphML、CSV、JSON-LD和Cypher格式。用户可从金融、法律、医疗、工业等领域的YAML模板,以及GraphRAG、LightRAG、Hyper-RAG和KG-Gen等抽取方法中选择使用。抽取需要同时具备支持function calling(以固定格式接收回答的调用方式)的LLM和兼容OpenAI的embedding模型。根据服务商文档,Anthropic、Gemini和DeepSeek需要另外搭配embedding模型,阿里云百炼的qwen-max和deepseek-v3只支持json_object格式,因此无法使用。它为每个文档记录来源和内容哈希,只重新处理有变化的文档,也可以单独撤回来自某一个文档的内容。he-mcp服务器只进行读取和导出,提供模板列表、信息查看、检索、问答和导出等tool。知识模板的语言选项只有中文和英文两种,指定目录时只读取该目录第一层的文件,没有文字层的PDF需要先经过OCR。

许可证

自定义许可 自定义或非标准许可。复用前请阅读许可证文件。

同领域的其他仓库

  • mongodb-developer/mongodb-jvm-showcase
    面向 Java 和 Kotlin 的独立 MongoDB 示例项目集合。涵盖驱动程序、框架、RAG 和向量搜索示例。
  • hydra-db/hydradb
    这是以S3兼容对象存储持久保存数据的Rust分布式图数据库,提供OpenCypher查询、Bolt连接及HTTPS API,并将查询节点和索引器分为独立计算角色。
  • realZachi/pg-jev
    这是一个通过TypeSafe的Jev评估自然语言条件,对行进行筛选、排序和分类的PostgreSQL扩展。它使用返回的概率,而非生成文本。
  • asciimoo/hister
    这是一个对访问过的页面和本地文件全文建立索引的私人搜索引擎。可通过网页界面、终端或经MCP连接的AI助手进行搜索。
  • Tencent/WeKnora
    WeKnora把原始文档转化为基于RAG的问答,以及使用检索、MCP tool和sandbox的ReAct agent。在Wiki Mode中,agent会构建相互链接、可编辑的markdown知识库,并保留修订历史。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)