AdaCodec: A Predictive Visual Code for Video MLLMs

발행일
출처
arXiv
논문 번호
292
분야
Computer Vision
arXiv 번호
2606.02569

비디오는 시간적으로 중복적이다. 인접한 프레임은 대개 대부분의 객체, 배경, 레이아웃을 공유한다.

AdaCodec은 비디오의 인접 프레임이 반복하는 정보를 줄이기 위해 멀티모달 언어 모델용 예측 시각 코드를 제안한다. 장면을 이전 맥락으로 예측하기 어려울 때만 전체 참조 프레임을 보내고, 그 밖에는 움직임과 예측 잔차를 압축한 P-토큰으로 프레임 간 변화만 전달한다. 이를 위해 멀티모달 모델에 맞춘 예측 코덱과 P-프레임 토크나이저, 기존 모델과 표현을 맞추는 2단계 학습 절차를 구성했다. 11개 벤치마크에서 같은 시각 토큰 예산의 Qwen3-VL-8B 프레임별 RGB 기준선보다 성능이 높았고, 장편 영상에서는 7분의 1 토큰만으로도 큰 기준선을 앞섰다. 일반 영상 과제에서도 평균 점수를 높이면서 첫 토큰 지연 시간을 9.26초에서 1.62초로 줄여, 시간 중복을 모델 입력 전에 제거하는 접근의 효율성을 보여준다.

핵심 요약

  • 그러나 기존의 비디오 멀티모달 대규모 언어 모델(video MLLM)은 보통 샘플링된 각 프레임을 독립적인 RGB 이미지로 인코딩하여, 시각 토큰이 이전 프레임에 이미 존재하는 내용을 반복하게 만든다.
  • 11개 벤치마크 전반에서 AdaCodec은 동일한 시각 토큰 예산 조건에서 Qwen3-VL-8B의 프레임별 RGB 기준선보다 향상된 성능을 보인다.
  • 심지어 7분의 1의 예산에서도 32k 토큰을 사용하는 AdaCodec은 모든 장편 비디오 벤치마크에서 224k 기준선을 능가한다. 5개의 일반 비디오 벤치마크에서는 평균 점수를 높이는 동시에 첫 토큰까지의 시간을 9.26초에서 1.62초로 대폭 단축한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)