DeepSeek-OCR: Contexts Optical Compression

발행일
출처
arXiv
논문 번호
087
분야
Vision / Compression
arXiv 번호
2510.18234

DeepSeek-OCR은 정보를 시각적으로 표현해 대형 언어 모델(LLM)이 긴 텍스트를 더 효율적으로 처리하게 하는 '컨텍스트 광학 압축'을 탐구한다.

DeepSeek-OCR은 정보를 시각적으로 표현해 대형 언어 모델(LLM)이 긴 텍스트를 더 효율적으로 처리하게 하는 '컨텍스트 광학 압축'을 탐구한다. 이 모델은 9~10배의 비전-텍스트 압축률에서 약 97%의 텍스트 디코딩 정밀도를 달성하고, 훨씬 적은 비전 토큰으로 OCR 성능의 새로운 기준을 세우며, 구조화된 데이터에 대한 고급 심층 파싱 기능도 제공한다.

핵심 요약

  • 대형 언어 모델(LLM)은 입력 시퀀스 길이가 늘어남에 따라 연산량이 이차적으로 증가하여 상당한 연산 및 메모리 문제에 직면하며, 이로 인해 긴 텍스트 컨텍스트를 처리하는 능력이 제한된다.
  • 비전-언어 모델(VLM)의 기존 비전 인코더는 복잡한 배포, 과도한 이미지 분할, 고해상도 문서에 대한 높은 활성화 메모리 소비 같은 한계를 겪는다.
  • 전통적인 OCR 모델은 LLM과 통합해 긴 컨텍스트를 이해할 때 최적의 비전-텍스트 압축률이나 정확한 텍스트 디코딩에 필요한 최소 비전 토큰 수를 명시적으로 다루지 못했다.
  • DeepSeek-OCR은 새로운 380M 매개변수 DeepEncoder와 DeepSeek3B-MoE 디코더로 구성된 종단 간 비전-언어 모델이다.
  • DeepEncoder는 SAM-base와 CLIP-large 모델을 핵심적인 16배 토큰 압축기(2계층 합성곱 신경망)와 결합하여 고해상도 이미지를 효율적으로 처리하고, 활성화 메모리를 줄이며, 최소한의 비전 토큰을 생성한다.
  • 이 모델은 타일링을 통해 초고해상도 입력을 처리하는 동적 'Gundam' 모드를 포함한 여러 해상도 모드를 지원하며, 전통적 OCR, 복잡한 인공 이미지(차트, 수식, 도형), 일반 비전 데이터를 아우르는 다양한 데이터셋으로 학습된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)