MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

발행일
출처
arXiv
논문 번호
610
분야
Computer Vision
arXiv 번호
2607.11562

문서 AI를 위한 시각-텍스트 기반 모델. 1.13억 장의 문서 이미지로 사전학습하여 기존 자연어 이미지 인코더를 압도한다. 0.7B 모델로 MDPBench SOTA 달성.

MonkeyOCRv2는 문서 AI를 위한 시각-텍스트 기반 사전학습 모델로, 1.13억 장 17개 언어의 문서 이미지 코퍼스(MonkeyDoc v2)로 학습된다. 이미지-텍스트 생성과 픽셀 수준 문서 복원을 jointly 학습하여 글자 스트로크와 레이아웃 세부사항을 보존하며, 기존 인코더를 대체했을 때 5개 문서 분석 태스크에서 일관된 성능 향상을 보인다. 0.7B 문서 파싱 모델로 MDPBench 오픈소스 SOTA를 달성했다.

핵심 요약

  • 1.13억 장 17개 언어의 최대 규모 문서 이미지 사전학습 코퍼스(MonkeyDoc v2) 구축
  • 이미지-텍스트 생성 + 픽셀 수준 문서 복원 jointly 학습으로 글자 수준 시각 인식 확보
  • CRNN 인식 정확도 58.7%→67.3%, 110M UniMERNet-T가 325M UniMERNet-B 능가
  • 0.7B 문서 파싱 모델로 MDPBench 오픈소스 SOTA, 이전 최고 3B dots.mocr 대비 +2.8%
  • 비전 인코더를 frozen 상태에서 Qwen3-VL-235B, GPT-5.2 등 대형 VLM보다 우수한 문서 이해 달성
  • CLIP, DINO, SAM 대비 8개 벤치마크에서 일관된 우위 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)