Scalable Visual Pretraining for Language Intelligence
- 발행일
- 출처
- arXiv
- 논문 번호
- 595
- 분야
- Computer Vision
- arXiv 번호
- 2607.09657
과학 문서를 텍스트로 변환하지 않고 시각적으로 직접 사전학습하는 Visual Pretraining(VP)이 텍스트 전용 사전학습보다 우수함을 입증한다.
상하이AI랩의 연구는 PDF 문서를 이미지로 렌더링해 시각적 잠재 공간에서 next-latent prediction을 수행하는 Visual Pretraining(VP)이 같은 말뭉치의 텍스트 전용 사전학습(TP)보다 일관되게 우수함을 보인다. Qwen3.5, Qwen3, Llama3.2, Llama3.1 등 4개 백본에서 GPQA Diamond +3.22, MMLU-Pro +2.1 점 향상을 기록했다. VP는 텍스트 토큰의 25%만 사용하면서도 더 높은 성능을 달성하며, 시각적 구조 밀도가 높은 문서일수록 gains이 크다. 이는 시각 사전학습이 언어 지능의 확장 가능한 경로임을 시사한다.
핵심 요약
- 문서를 텍스트로 파싱하지 않고 원본 시각 패치에서 직접 next-latent prediction으로 사전학습하는 VP 프레임워크 제안
- GPQA Diamond 최대 +3.22, MMLU-Pro +2.1 — 4개 백본에서 TP 대비 일관된 우위 입증
- 토큰 예산 25%로 동등 이상 성능 달성 — 시각 표현이 텍스트보다 압축 효율적
- 시각 구조 밀도가 높은 문서(그림, 수식, 표)에서 VP gains이 가장 큼 — 정보 손실 회복 효과
- 멀티모달 모델뿐 아니라 언어 전용 모델에서도 VP가 유효 — 아키텍처 비종속적
- 동결된 비전 인코더 + 학습 가능한 투영층만으로 autoregressive 백본에 시각 스트림 통합
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.