Linear Scaling Video VLMs for Long Video Understanding
- 발행일
- 출처
- arXiv
- 논문 번호
- 284
- 분야
- Computer Vision
- arXiv 번호
- 2605.31598
긴 영상 이해를 위한 선형 스케일링 비디오 VLM이다.
비디오 비전-언어 모델(VLM)은 장기 시야 및 스트리밍 환경에서 점점 더 많이 사용되고 있지만, 대부분의 비디오 인코더는 여전히 시공간 셀프 어텐션에 의존하여 연산량과 지연 시간이 프레임 수에 대해 제곱으로 증가한다. 기존의 효율화 방법들은 확장성을 개선하지만, 예컨대 공격적인 프레임이나 토큰 제거나 거친 어텐션 근사를 통해 완전한 셀프 어텐션 대비 정확도를 잃는 경우가 많다. 이 논문은 사전학습된 긴 영상 VLM을, 고정 용량의 중요도 기반 순환 상태로 프레임 간 맥락을 운반하고 디코딩에 사용되는 두 번째의 프레임별 전체 캐시와 짝지어, 선형 시간 비디오 프리필에 적응시키는 추론 시점 방법 StateKV를 소개한다. 세 개의 긴 영상 벤치마크와 세 계열 및 여러 규모에 걸친 일곱 개 모델 전반에서, StateKV는 미세조정이나 구조 변경 없이도 완전한 셀프 어텐션에 근접하며 지배적인 슬라이딩 윈도우 및 최근성 기반 스트리밍 근사를 일관되게 능가한다. StateKV는 또한 측정된 FLOPs로 비디오 프리필 비용을 절감하여, 고정된 연산 예산에서 더 큰 모델을 실행함으로써 더 강력한 정확도를 가능하게 한다. 이러한 결과는 확장 가능한 긴 영상 이해를 향한 실용적인 진전을 시사한다.
핵심 요약
- 기존의 효율화 방법들은 확장성을 개선하지만, 예컨대 공격적인 프레임이나 토큰 제거나 거친 어텐션 근사를 통해 완전한 셀프 어텐션 대비 정확도를 잃는 경우가 많다.
- 이러한 결과는 확장 가능한 긴 영상 이해를 향한 실용적인 진전을 시사한다.
- 비디오 비전-언어 모델(VLM)은 장기 시야 및 스트리밍 환경에서 점점 더 많이 사용되고 있지만, 대부분의 비디오 인코더는 여전히 시공간 셀프 어텐션에 의존하여 연산량과 지연 시간이 프레임 수에 대해 제곱으로 증가한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.