yifanfeng97/Hyper-Extract

出典
GitHub
初登場日
分野
RAGと検索
GitHubスター数
4,068
主な言語
Python
ウェブサイト
yifanfeng97.github.io/Hyper-Extract (新しいタブで開きます)

外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

yifanfeng97/Hyper-Extract

何をするか

Hyper-Extractは文書から事実と関係を抽出し、ナレッジグラフのような構造化データに変換するPythonライブラリで、he CLIとhe-mcpサーバーも提供しています。散らばった文書を検索や質疑応答に使える知識データに整理したい開発者や分析担当者向けのツールです。txtとmdファイルはそのまま読み込み、markitdownベースの追加インストール項目を入れるとPDF、DOCX、PPTX、XLSXも読み込めます。結果はリスト、集合、グラフ、ハイパーグラフ、時間グラフ、空間グラフ、時空間グラフ、文書コレクションといった構造で保存され、Obsidian、GraphML、CSV、JSON-LD、Cypherの形式に書き出せます。金融、法律、医療、産業などの分野別YAMLテンプレートと、GraphRAG、LightRAG、Hyper-RAG、KG-Genなどの抽出方式から選んで使います。抽出には、決まった形式で回答を受け取る呼び出し方式であるfunction callingに対応したLLMと、OpenAI互換のembeddingモデルの両方が必要です。プロバイダーのドキュメントによると、Anthropic、Gemini、DeepSeekは別のembeddingモデルと組み合わせる必要があり、Bailianのqwen-maxとdeepseek-v3はjson_object形式のみに対応するため使えません。文書ごとに出典と内容のハッシュを記録して変更された文書だけを再処理し、1つの文書に由来する内容だけを取り消すこともできます。he-mcpサーバーは読み取りと書き出しだけを行い、テンプレート一覧、情報表示、検索、質疑応答、書き出しのtoolを提供します。知識テンプレートの言語オプションは中国語と英語の2つで、フォルダーを指定するとその直下のファイルだけを読み、テキスト層のないPDFは先にOCRを通す必要があります。

ライセンス

独自ライセンス 標準ではない独自ライセンスです。再利用の前にライセンスファイルを確認してください。

同じ分野のリポジトリ

  • mongodb-developer/mongodb-jvm-showcase
    JavaとKotlin向けのMongoDB独立サンプルプロジェクト集です。ドライバー、フレームワーク、RAG、ベクトル検索の例を含みます。
  • hydra-db/hydradb
    S3互換オブジェクトストレージにデータを保存し、OpenCypherクエリ、Bolt接続、HTTPS APIを提供するRust製の分散グラフデータベースです。クエリ処理ノードとインデクサーの計算役割を分離します。
  • realZachi/pg-jev
    TypeSafeのJevが評価する自然言語の条件で行を絞り込み、順位付け、分類するPostgreSQL拡張です。生成された文章ではなく、返された確率を使います。
  • asciimoo/hister
    訪問したページとローカルファイルの全文を索引化する個人用検索エンジンです。ウェブ画面、ターミナル、MCPで接続したAIアシスタントから検索できます。
  • Tencent/WeKnora
    WeKnoraは元の文書から、RAGベースの質疑応答と、検索、MCP tool、sandboxを使うReAct agentを作ります。Wiki Modeではagentが相互にリンクされた編集可能なmarkdownナレッジベースを作り、修正履歴を残します。

Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。

GitHubで見る (新しいタブで開きます)