StarTrail-org/PixelRAG

来源
GitHub
首次上榜日期
领域
RAG 与检索
GitHub 星标数
9,976
主要语言
Python
网站
arxiv.org/pdf/2606.28344 (在新标签页中打开)

本页介绍外部开源仓库,并非 HDATF 产品。

StarTrail-org/PixelRAG

它做什么

PixelRAG把网页、PDF和图片渲染成截图,并直接在图像上进行检索,从而保留HTML解析时会丢失的表格、图表和版式。它是一篇研究论文的官方代码。

对 ATF 的帮助

以页面图像而非解析后的文本进行检索的方式,值得与Company Brain检索含有表格、图表和复杂版式的公司文档的做法进行比较。

许可证

Apache-2.0 宽松许可,含专利授权。可商用,需保留声明并注明修改。

同领域的其他仓库

  • semantica-agi/semantica
    一个Python库,可导入企业数据、提取关键信息、构建context graph和knowledge graph,并在其上进行图分析和推理。它保留决策溯源记录,实现端到端可追溯。
  • GoogleCloudPlatform/knowledge-catalog
    面向Google Cloud Knowledge Catalog(原名Dataplex)的工具、agent和示例。Knowledge Catalog是为结构化和非结构化数据提供knowledge graph的数据目录和元数据平台,示例展示了面向AI agent的context管理、信息补充和检索。
  • zvec-ai/zvec-grep
    zg 是一个本地优先的搜索工具,把 ripgrep、BM25 和向量搜索统一在同一个接口下,可在 CLI 中直接使用,也可由 agent 调用。它能搜索代码、文档和结构化数据,并返回带来源位置的排序结果。
  • RyanCodrai/turbovec
    一个基于Google Research的TurboQuant量化方法、用Rust编写并提供Python绑定的vector index。它无需训练步骤即可添加向量,只保存变更部分,在搜索时按id过滤,完全在本地运行。
  • Tencent/WeKnora
    WeKnora把原始文档转化为基于RAG的问答,以及使用检索、MCP tool和sandbox的ReAct agent。在Wiki Mode中,agent会构建相互链接、可编辑的markdown知识库,并保留修订历史。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)