baidu/Unlimited-OCR

출처
GitHub
처음 오른 날
분야
문서
GitHub 별 수
25,740
주 언어
Python

외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

baidu/Unlimited-OCR

무엇을 하나

one-shot long-horizon parsing을 목표로 한 OCR 모델로, DeepSeek-OCR을 한 단계 더 발전시키려 합니다. NVIDIA GPU에서 Hugging Face Transformers로, 또는 vLLM으로 추론하고 ms-swift로 학습할 수 있습니다.

ATF에 주는 도움

스캔한 회사 문서나 논문을 Company Brain이나 LabChin에서 검색할 수 있는 텍스트로 바꾸는 OCR 단계로 비교해 볼 만합니다.

라이선스

MIT 허용 범위가 넓습니다. 저작권 표시를 유지하면 상업적 이용과 수정이 가능합니다.

같은 분야 저장소

  • langchain-ai/openwiki
    OpenWiki는 agent가 코드베이스나 개인 자료를 읽고 서로 링크된 Markdown wiki를 써서, 변경이 있을 때마다 최신으로 유지하는 CLI입니다. 핵심 사실을 버전이 붙은 원본 근거와 연결해 추적합니다.
  • opendatalab/MinerU
    PDF, Office 파일, 스캔한 문서 이미지 등을 LLM과 agent workflow에서 쓸 수 있는 Markdown이나 JSON으로 바꿉니다. 4.0 버전은 파싱, 로컬 문서 라이브러리, 서비스 도구를 한 흐름으로 묶었고, 빠른 미리보기부터 까다로운 레이아웃까지 파싱 수준을 여러 단계로 나눠 제공합니다.
  • iOfficeAI/OfficeCLI
    AI agent가 Office를 설치하지 않고도 Word, Excel, PowerPoint 파일을 읽고, 고치고, 자동화할 수 있게 하는 단일 실행 파일 CLI 도구입니다. .docx, .xlsx, .pptx를 HTML이나 PNG로 렌더링해 agent가 결과를 보고 고칠 수 있게 합니다.
  • run-llama/liteparse
    클라우드 서비스나 LLM 기능 없이 로컬에서 PDF 텍스트를 위치 정보, bounding box와 함께 추출하는 파서입니다. Tesseract OCR을 포함하고, 외부 OCR 서버를 연결할 수 있으며, 문서에 더 무거운 파싱이 필요한지 확인합니다.
  • chuspeeism/dashi-ppt-skill
    문서를 웹 프레젠테이션으로 만드는 agent skill입니다. 시각 테마는 12가지입니다. 페이지마다 브라우저에서 글, 레이아웃, 미디어를 고치는 편집 컨트롤이 있습니다. 결과는 HTML, PDF, 편집 가능한 PPTX로 내보낼 수 있습니다.

Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.

GitHub에서 보기 (새 탭에서 열림)