OvisOCR2 Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 638
- 분야
- Computer Vision
- arXiv 번호
- 2607.13639
0.8B 파라미터로 OmniDocBench v1.6 96.58점을 달성한 엔드투엔드 문서 파싱 모델.
OvisOCR2는 0.8B 파라미터의 엔드투엔드 문서 파싱 모델로, 문서 페이지 이미지를 입력받아 텍스트, 수식, 표, 이미지 영역을 포함한 Markdown을 자연스러운 읽기 순서로 생성한다. 실제 문서 주석과 합성 페이지를 결합한 데이터 엔진과 SFT-RL-Distillation-Fusion 훈련 레시피를 통해, OmniDocBench v1.6에서 96.58점으로 pipeline 기반 모델들을 제치고 SOTA를 달성했다.
핵심 요약
- 문서 페이지 이미지를 받아 텍스트, 수식, 표, 시각 영역을 자연스러운 읽기 순서의 Markdown으로 한 번에 생성한다.
- 실제 문서 주석과 같은 HTML에서 이미지와 정답을 만든 합성 페이지를 섞고, 지도학습·강화학습·온폴리시 증류·모델 융합을 적용했다.
- 0.8B 모델이 OmniDocBench v1.6에서 96.58점, PureDocBench에서 Avg3 75.06으로 각각 가장 높은 성적을 기록했다.
- 작은 단일 모델로 파이프라인 방식을 앞서 문서 검색과 지식화 시스템의 배포 구성을 단순화할 가능성을 보여준다.
- 다만 검증 범위는 페이지 이미지에서 Markdown을 만드는 두 공개 벤치마크와 자체 벤치마크여서 다른 문서 처리 흐름의 성능까지 보장하지는 않는다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.