LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

발행일
출처
arXiv
논문 번호
247
분야
Computer Vision
arXiv 번호
2605.25979

Glint Lab, AIM for Health Lab, MVP Lab의 연구진은 비디오를 연속적인 비트 비용 스트림으로 처리하는 비전-언어 모델 LLaVA-OneVision-2를 개발했으며, 이는 전통적인 프레임 중심 패러다임에서 벗어나 네이티브 비디오 코덱 구조를 활용한다.

LLaVA-OneVision-2는 압축 영상을 고정 간격의 프레임 묶음이 아니라 비트 비용이 변하는 연속 스트림으로 처리하는 비전-언어 모델이다. 비트 비용으로 시간 구간을 나누고 움직임 잔차로 중요한 공간 증거를 골라, 제한된 토큰을 사건이 많은 부분에 집중한다. 약 800만 개의 재캡션 영상과 400만 개의 공간 학습 샘플을 사용했으며, 이미지와 프레임 및 코덱 캔버스를 공통 3차원 위치 표현에 놓는다. 8B 모델은 JumpScore에서 74.9 mAP를 기록했고 같은 토큰 예산에서 코덱 스트림 입력이 균일 프레임 샘플링보다 시간 위치 찾기를 9.7점 높였다. 이 결과는 영상 코덱의 예측 정보를 장시간 영상 이해와 공간 추론을 위한 선택적 지각 자원 배분에 활용할 수 있음을 보여준다.

핵심 요약

  • 3단계(긴 비디오)에서는 모델이 약 800만 개 클립으로 구성되고 총 1,040억 토큰에 달하는 길이 계층화된 비디오 캡션 코퍼스에 노출된다. 이 비디오들은 30초에서 15분까지 다양하며, 모델이 긴 시간 동안 맥락을 유지하도록 학습시킨다.
  • 4단계(코덱 및 공간)에서는 코덱 네이티브 학습이 도입된다. 10~15분 길이의 비디오는 가변 길이 GOP 파이프라인을 사용하여 재인코딩된다. 추가로, 모델은 실내 스캔에서 객체를 식별하거나 체화된 시뮬레이터에서 움직임을 추적하는 등 2D 및 3D 공간 추론에 초점을 맞춘 400만 개 샘플을 포함하는 LLaVA-OneVision-2-Spatial-4M 코퍼스로 학습된다.
  • 코덱 스트림 접근법은 시간적 그라운딩과 시각 인식에서 현저히 더 우수했다. '이벤트를 담은' 순간에 토큰을 재할당함으로써, 균일 샘플링이 놓치는 움직임 역학을 포착한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)