GoogleCloudPlatform/knowledge-catalog

출처
GitHub
처음 오른 날
분야
RAG와 검색
GitHub 별 수
9,221
주 언어
TypeScript
웹사이트
cloud.google.com/products/knowledge-catalog?e=48754805 (새 탭에서 열림)

외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

GoogleCloudPlatform/knowledge-catalog

무엇을 하나

Google Cloud Knowledge Catalog(이전 이름 Dataplex)용 도구, agent, 샘플 모음입니다. Knowledge Catalog는 정형, 비정형 데이터에 knowledge graph를 제공하는 데이터 카탈로그이자 메타데이터 플랫폼입니다. 샘플은 AI agent를 위한 context 관리, 정보 보강, 검색을 보여 줍니다.

ATF에 주는 도움

agent가 데이터를 가져가기 전에 업무상 의미를 붙여 두는 방식은 Company Brain이 접근 범위 안에서 회사 자료와 기록을 업무에 연결하는 방식과 비교해 볼 만합니다.

라이선스

Apache-2.0 허용 범위가 넓고 특허 사용 허락이 포함됩니다. 상업적 이용이 가능하며 고지 문구를 유지하고 변경 사실을 밝혀야 합니다.

같은 분야 저장소

  • StarTrail-org/PixelRAG
    PixelRAG는 웹 페이지, PDF, 이미지를 스크린샷으로 바꾸고 그 이미지에서 바로 검색합니다. 그래서 HTML 파싱에서 빠지는 표, 차트, 레이아웃이 그대로 남습니다. 연구 논문의 공식 코드입니다.
  • RyanCodrai/turbovec
    Google Research의 TurboQuant 양자화 방식을 바탕으로 Rust로 만들고 Python 바인딩을 제공하는 vector index입니다. 학습 단계 없이 벡터를 추가하고, 바뀐 부분만 저장하며, 검색 시점에 id로 거르고, 전부 로컬에서 돌아갑니다.
  • semantica-agi/semantica
    기업 데이터를 받아 핵심 정보를 뽑고 context graph와 knowledge graph를 만든 뒤, 그 위에서 그래프 분석과 추론을 돌리는 Python 라이브러리입니다. 처음부터 끝까지 추적할 수 있도록 결정의 출처 기록을 남깁니다.
  • lfnovo/open-notebook
    Open Notebook은 Google Notebook LM을 대신하는 오픈소스 self-hosted 도구입니다. PDF, 동영상, 오디오, 웹 페이지를 모아 전문 검색과 벡터 검색을 하고, 그 내용을 바탕으로 대화하며, 여러 화자가 나오는 podcast를 만듭니다.
  • zvec-ai/zvec-grep
    zg는 ripgrep, BM25, vector search를 하나의 인터페이스로 묶은 local-first 검색 도구로, CLI에서 직접 쓰거나 agent가 쓸 수 있습니다. 코드, 문서, 구조화된 데이터를 검색하고 출처 위치가 붙은 순위 결과를 돌려줍니다.

Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.

GitHub에서 보기 (새 탭에서 열림)