yifanfeng97/Hyper-Extract

출처
GitHub
처음 오른 날
분야
RAG와 검색
GitHub 별 수
4,068
주 언어
Python
웹사이트
yifanfeng97.github.io/Hyper-Extract (새 탭에서 열림)

외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

yifanfeng97/Hyper-Extract

무엇을 하나

Hyper-Extract는 문서에서 사실과 관계를 뽑아 지식 그래프 같은 구조화 자료로 바꾸는 Python 라이브러리이며, he CLI와 he-mcp 서버를 함께 제공합니다. 흩어진 문서를 검색과 질의응답에 쓸 지식 자료로 정리하려는 개발자와 분석 담당자를 위한 도구입니다. txt와 md 파일은 바로 읽고, markitdown 기반의 선택 설치 항목을 더하면 PDF, DOCX, PPTX, XLSX도 읽습니다. 결과는 목록, 집합, 그래프, 하이퍼그래프, 시간 그래프, 공간 그래프, 시공간 그래프, 문서 모음 같은 구조로 저장하고 Obsidian, GraphML, CSV, JSON-LD, Cypher 형식으로 내보낼 수 있습니다. 금융, 법률, 의료, 산업 같은 분야별 YAML 템플릿과 GraphRAG, LightRAG, Hyper-RAG, KG-Gen 같은 추출 방법 중에서 골라 씁니다. 추출에는 function calling(정해진 형식으로 답을 돌려받는 호출 방식)을 지원하는 LLM과 OpenAI 호환 embedding 모델이 함께 필요합니다. 공급자 문서에 따르면 Anthropic, Gemini, DeepSeek는 embedding 모델을 따로 짝지어야 하고, Bailian의 qwen-max와 deepseek-v3는 json_object 형식만 지원해 쓸 수 없습니다. 문서마다 출처와 내용 hash를 기록해 바뀐 문서만 다시 처리하고, 문서 하나에서 온 내용만 따로 되돌릴 수도 있습니다. he-mcp 서버는 읽기와 내보내기만 하며 템플릿 목록, 정보 조회, 검색, 질의응답, 내보내기 tool을 제공합니다. 지식 템플릿의 언어 옵션은 중국어와 영어 두 가지이고, 폴더를 지정하면 그 폴더 바로 아래 파일만 읽으며, 글자 층이 없는 PDF는 OCR을 먼저 거쳐야 합니다.

라이선스

자체 라이선스 표준이 아닌 자체 라이선스입니다. 재사용 전에 라이선스 파일을 직접 읽어야 합니다.

같은 분야 저장소

  • mongodb-developer/mongodb-jvm-showcase
    Java와 Kotlin용 MongoDB 독립 예제 프로젝트 모음입니다. 드라이버, 프레임워크, RAG와 벡터 검색 예제를 포함합니다.
  • hydra-db/hydradb
    S3 호환 객체 저장소에 데이터를 보관하며 OpenCypher 질의와 Bolt 연결, HTTPS API를 제공하는 Rust 분산 그래프 데이터베이스입니다. 질의 처리 노드와 인덱서의 계산 역할을 분리합니다.
  • realZachi/pg-jev
    TypeSafe의 Jev가 평가하는 자연어 조건으로 행을 필터링하고 정렬하며 분류하는 PostgreSQL 확장입니다. 생성된 문장 대신 반환된 확률을 사용합니다.
  • asciimoo/hister
    방문한 페이지와 로컬 파일의 전체 내용을 색인하는 개인용 검색 엔진입니다. 웹 화면, 터미널, MCP로 연결한 AI 도우미에서 검색할 수 있습니다.
  • Tencent/WeKnora
    WeKnora는 원본 문서로 RAG 기반 질의응답과, 검색, MCP tool, sandbox를 쓰는 ReAct agent를 만듭니다. Wiki Mode에서는 agent가 서로 연결되고 편집할 수 있는 markdown 지식 베이스를 만들고 수정 이력을 남깁니다.

Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.

GitHub에서 보기 (새 탭에서 열림)