Scaling Native Multimodal Pre-Training From Scratch

발행일
출처
arXiv
논문 번호
721
분야
LLMs / NLP
arXiv 번호
2607.22043

처음부터 텍스트+이미지를 함께 학습하는 '네이티브 멀티모달' 방식의 최적 모델 크기와 데이터 비율을 수학법칙으로 규명한 연구다.

이 논문은 한마디로 텍스트와 이미지를 처음부터 함께 학습할 때, 주어진 컴퓨팅 예산에서 최적의 모델 크기·데이터 양·데이터 비율을 수학법칙으로 규명한 연구다. 핵심 발견은 언어 학습과 멀티모달 학습의 스케일링 법칙이 다르다는 것이다. 언어는 데이터 비율에 상관없이 일정하게 학습되지만, 멀티모달은 텍스트 비율이 높을수록 더 큰 모델이 필요하다. 또한 네이티브 멀티모달 사전학습이 텍스트만 하는 공간 추론 능력까지 향상시킨다는 것을 실험으로 확인했다.

핵심 요약

  • 언어 목적함수의 스케일링 법칙은 데이터 구성에 거의 영향받지 않지만, 멀티모달 목적함수는 데이터 비율에 매우 민감하다.
  • 텍스트 비중이 높은 데이터는 모델이 커야 효율적이며, 최적 자원 분배가 모델 용량 쪽으로 이동한다.
  • 모델 크기, 토큰 수, 데이터 비율의 최적 조합을 지정하는 '효율성 프론티어(efficiency frontier)'를 수식으로 도출했다.
  • 네이티브 멀티모달 학습이 순수 텍스트 공간 추론 능력까지 향상시키는 크로스모달 전이 효과를 확인했다.
  • 3B 파라미터 모델에서 멀티모달 in-context learning 능력이 자연스럽게 출현함을 관찰했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)