VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
- 발행일
- 출처
- arXiv
- 논문 번호
- 640
- 분야
- Computer Vision
- arXiv 번호
- 2607.14935
4B 파라미터로 완전 오픈소스 비디오 이해 모델. 효율적 3D 비전 인코더와 적응형 해상도로 기존 대비 적은 compute로 더 좋은 성능.
이 논문은 한마디로 비디오를 이해하는 멀티모달 모델을 완전 오픈소스(가중치·코드·데이터 전부)로 만들었다. 핵심은 3D 비전 트랜스포머(I3D-ViT)로 프레임 간 시공간 정보를 압축하고, 중요도에 따라 해상도를 조절하는 것이다. 4B 파라미터로 기존 오픈소스 SOTA(Qwen3-VL, Molmo2)를 능가하면서도 더 빠르다.
핵심 요약
- 3D 비전 트랜스포머(I3D-ViT)로 프레임을 개별 이미지가 아닌 시공간 묶음으로 처리해 토큰 수를 크게 줄였다.
- 중요도에 따라 프레임 해상도를 조절하는 적응형 메커니즘으로 실시간 스트리밍 처리 효율을 높였다.
- 300만 건의 고품질 멀티모달 instruction 데이터(Academic2M + LV116K + OL617K)를 구축해 공개했다.
- 4B로 기존 동급 오픈소스 모델들을 MotionBench, VideoMME, LVBench 등 12개 벤치마크에서 능가했다.
- 모델, 코드, 학습 전략, 데이터셋, 파이프라인까지 전부 공개해 재현 가능한 기반을 제공한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.