Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
- 발행일
- 출처
- arXiv
- 논문 번호
- 752
- 분야
- Computer Vision
- arXiv 번호
- 2607.24904
이 논문은 비디오 코덱 기술을 활용해 토큰 수를 75% 줄이면서도 기존 VLM과 동등하거나 더 좋은 성능을 내는 스트리밍 멀티모달 모델(Mage-VL)을 만든 연구다.
이 논문은 한마디로 비디오 압축 기술(H.265 코덱)을 비전 토크나이저에 직접 통합해서, 실시간 비디오 이해가 가능한 4B 파라미터 모델을 만들었다. 핵심 혁신은 움직이는 영역만 선택적으로 토큰화하는 Mage-ViT로, 정적 배경은 버리고 동적 패치만 남겨 토큰을 75% 이상 줄인다. 560M 라벨 없는 이미지 + 1억 비디오 프레임으로 처음부터 훈련했는데, 수십억 쌍을 쓴 기존 인코더와 동등한 성능을 보였다. 이중 시스템(빠른 감지 + 심층 추론) 아키텍처로 Qwen3-VL-4B와 정적 작업에서 동등, 비디오/공간 추론에서는 더 우수한 결과를 냈다.
핵심 요약
- 코덱 네이티브 토크나이저(Mage-ViT)가 동적 패치만 선택 인코딩해서 시각 토큰을 75% 이상 절감한다.
- 560M 라벨 없는 이미지만으로 처음부터 훈련해 수십억 이미지-텍스트 쌍을 쓴 SigLIP2와 동등한 성능을 달성했다 (사전학습 데이터 효율성).
- 이중 시스템: System 1 이벤트 게이트(빠른 반응) + System 2 인과 디코더(심층 추론)로 실시간 스트리밍 이해를 지원한다.
- 4B 파라미터로 Qwen3-VL-4B와 정적 작업 동등, 비디오 이해와 2D/3D 공간 추론에서는 15B Phi-4 모델까지 능가한다.
- 최대 3.5배 추론 속도 향상을 달성했고 7가지 핵심 경험적 발견을 보고했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.