MonkeyOCRv2: A Visual-Text Foundation Model for Document AI
- 발행일
- 출처
- arXiv
- 논문 번호
- 610
- 분야
- Computer Vision
- arXiv 번호
- 2607.11562
문서 AI를 위한 시각-텍스트 기반 모델. 1.13억 장의 문서 이미지로 사전학습하여 기존 자연어 이미지 인코더를 압도한다. 0.7B 모델로 MDPBench SOTA 달성.
MonkeyOCRv2는 문서 AI를 위한 시각-텍스트 기반 사전학습 모델로, 1.13억 장 17개 언어의 문서 이미지 코퍼스(MonkeyDoc v2)로 학습된다. 이미지-텍스트 생성과 픽셀 수준 문서 복원을 jointly 학습하여 글자 스트로크와 레이아웃 세부사항을 보존하며, 기존 인코더를 대체했을 때 5개 문서 분석 태스크에서 일관된 성능 향상을 보인다. 0.7B 문서 파싱 모델로 MDPBench 오픈소스 SOTA를 달성했다.
핵심 요약
- 1.13억 장 17개 언어의 최대 규모 문서 이미지 사전학습 코퍼스(MonkeyDoc v2) 구축
- 이미지-텍스트 생성 + 픽셀 수준 문서 복원 jointly 학습으로 글자 수준 시각 인식 확보
- CRNN 인식 정확도 58.7%→67.3%, 110M UniMERNet-T가 325M UniMERNet-B 능가
- 0.7B 문서 파싱 모델로 MDPBench 오픈소스 SOTA, 이전 최고 3B dots.mocr 대비 +2.8%
- 비전 인코더를 frozen 상태에서 Qwen3-VL-235B, GPT-5.2 등 대형 VLM보다 우수한 문서 이해 달성
- CLIP, DINO, SAM 대비 8개 벤치마크에서 일관된 우위 입증
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.