Scalable Visual Pretraining for Language Intelligence

발행일
출처
arXiv
논문 번호
595
분야
Computer Vision
arXiv 번호
2607.09657

과학 문서를 텍스트로 변환하지 않고 시각적으로 직접 사전학습하는 Visual Pretraining(VP)이 텍스트 전용 사전학습보다 우수함을 입증한다.

상하이AI랩의 연구는 PDF 문서를 이미지로 렌더링해 시각적 잠재 공간에서 next-latent prediction을 수행하는 Visual Pretraining(VP)이 같은 말뭉치의 텍스트 전용 사전학습(TP)보다 일관되게 우수함을 보인다. Qwen3.5, Qwen3, Llama3.2, Llama3.1 등 4개 백본에서 GPQA Diamond +3.22, MMLU-Pro +2.1 점 향상을 기록했다. VP는 텍스트 토큰의 25%만 사용하면서도 더 높은 성능을 달성하며, 시각적 구조 밀도가 높은 문서일수록 gains이 크다. 이는 시각 사전학습이 언어 지능의 확장 가능한 경로임을 시사한다.

핵심 요약

  • 문서를 텍스트로 파싱하지 않고 원본 시각 패치에서 직접 next-latent prediction으로 사전학습하는 VP 프레임워크 제안
  • GPQA Diamond 최대 +3.22, MMLU-Pro +2.1 — 4개 백본에서 TP 대비 일관된 우위 입증
  • 토큰 예산 25%로 동등 이상 성능 달성 — 시각 표현이 텍스트보다 압축 효율적
  • 시각 구조 밀도가 높은 문서(그림, 수식, 표)에서 VP gains이 가장 큼 — 정보 손실 회복 효과
  • 멀티모달 모델뿐 아니라 언어 전용 모델에서도 VP가 유효 — 아키텍처 비종속적
  • 동결된 비전 인코더 + 학습 가능한 투영층만으로 autoregressive 백본에 시각 스트림 통합

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)