Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
- 발행일
- 출처
- arXiv
- 논문 번호
- 821
- 분야
- Computer Vision
- arXiv 번호
- 2608.05000
멀티모달 사전학습에서 언어·시각·생성이 어떻게 지식을 주고받는지 4가지 핵심 원리를 발견하고, 5% 연산량으로 강력한 성능을 내는 레시피를 제시했다.
이 논문은 한마디로 멀티모달 AI를 학습시킬 때 언어와 시각 정보가 서로 어떻게 영향을 주는지 체계적으로 분석한 연구다. 언어 이해력이 시각 생성을 크게 돕고, 반대 방향은 약한 비대칭성을 발견했다. 또 초기부터 언어와 시각을 함께 학습하는 것이 나중에 합치는 것보다 훨씬 효과적임을 증명했다. 이를 바탕으로 단 5% 연산량으로도 강력한 성능을 내는 학습 레시피를 만들어 13.5B MoE 모델로 검증했다.
핵심 요약
- 언어와 시각 이해가 시각 생성을 이끄는 강한 프라이어 역할을 하지만, 역방향 전이는 약한 비대칭 구조를 발견했다.
- 데이터 복잡도가 낮을 때는 모달리티 간 시너지가, 높을 때는 경쟁이 발생하며 공유 어텐션 구조가 시너지를 촉진한다.
- 초기 통합 학습이 후기 정렬보다 압도적으로 효과적이며, 늦게 합치면 '시각 나태함(vision laziness)' 현상이 나타난다.
- 이 원리들로 5% 연산량만 사용하는 학습 레시피를 만들어 2T 토큰으로 13.5B MoE 모델을 학습, 강력한 생성 성능을 달성했다.
- 시각 토크나이저 설계와 무관하게 아키텍처 선택에 따른 시너지 패턴이 일관되게 나타났다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.