VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

발행일
출처
arXiv
논문 번호
640
분야
Computer Vision
arXiv 번호
2607.14935

4B 파라미터로 완전 오픈소스 비디오 이해 모델. 효율적 3D 비전 인코더와 적응형 해상도로 기존 대비 적은 compute로 더 좋은 성능.

이 논문은 한마디로 비디오를 이해하는 멀티모달 모델을 완전 오픈소스(가중치·코드·데이터 전부)로 만들었다. 핵심은 3D 비전 트랜스포머(I3D-ViT)로 프레임 간 시공간 정보를 압축하고, 중요도에 따라 해상도를 조절하는 것이다. 4B 파라미터로 기존 오픈소스 SOTA(Qwen3-VL, Molmo2)를 능가하면서도 더 빠르다.

핵심 요약

  • 3D 비전 트랜스포머(I3D-ViT)로 프레임을 개별 이미지가 아닌 시공간 묶음으로 처리해 토큰 수를 크게 줄였다.
  • 중요도에 따라 프레임 해상도를 조절하는 적응형 메커니즘으로 실시간 스트리밍 처리 효율을 높였다.
  • 300만 건의 고품질 멀티모달 instruction 데이터(Academic2M + LV116K + OL617K)를 구축해 공개했다.
  • 4B로 기존 동급 오픈소스 모델들을 MotionBench, VideoMME, LVBench 등 12개 벤치마크에서 능가했다.
  • 모델, 코드, 학습 전략, 데이터셋, 파이프라인까지 전부 공개해 재현 가능한 기반을 제공한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)