Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

발행일
출처
arXiv
논문 번호
752
분야
Computer Vision
arXiv 번호
2607.24904

이 논문은 비디오 코덱 기술을 활용해 토큰 수를 75% 줄이면서도 기존 VLM과 동등하거나 더 좋은 성능을 내는 스트리밍 멀티모달 모델(Mage-VL)을 만든 연구다.

이 논문은 한마디로 비디오 압축 기술(H.265 코덱)을 비전 토크나이저에 직접 통합해서, 실시간 비디오 이해가 가능한 4B 파라미터 모델을 만들었다. 핵심 혁신은 움직이는 영역만 선택적으로 토큰화하는 Mage-ViT로, 정적 배경은 버리고 동적 패치만 남겨 토큰을 75% 이상 줄인다. 560M 라벨 없는 이미지 + 1억 비디오 프레임으로 처음부터 훈련했는데, 수십억 쌍을 쓴 기존 인코더와 동등한 성능을 보였다. 이중 시스템(빠른 감지 + 심층 추론) 아키텍처로 Qwen3-VL-4B와 정적 작업에서 동등, 비디오/공간 추론에서는 더 우수한 결과를 냈다.

핵심 요약

  • 코덱 네이티브 토크나이저(Mage-ViT)가 동적 패치만 선택 인코딩해서 시각 토큰을 75% 이상 절감한다.
  • 560M 라벨 없는 이미지만으로 처음부터 훈련해 수십억 이미지-텍스트 쌍을 쓴 SigLIP2와 동등한 성능을 달성했다 (사전학습 데이터 효율성).
  • 이중 시스템: System 1 이벤트 게이트(빠른 반응) + System 2 인과 디코더(심층 추론)로 실시간 스트리밍 이해를 지원한다.
  • 4B 파라미터로 Qwen3-VL-4B와 정적 작업 동등, 비디오 이해와 2D/3D 공간 추론에서는 15B Phi-4 모델까지 능가한다.
  • 최대 3.5배 추론 속도 향상을 달성했고 7가지 핵심 경험적 발견을 보고했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)