LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
- 발행일
- 출처
- arXiv
- 논문 번호
- 247
- 분야
- Computer Vision
- arXiv 번호
- 2605.25979
Glint Lab, AIM for Health Lab, MVP Lab의 연구진은 비디오를 연속적인 비트 비용 스트림으로 처리하는 비전-언어 모델 LLaVA-OneVision-2를 개발했으며, 이는 전통적인 프레임 중심 패러다임에서 벗어나 네이티브 비디오 코덱 구조를 활용한다.
LLaVA-OneVision-2는 압축 영상을 고정 간격의 프레임 묶음이 아니라 비트 비용이 변하는 연속 스트림으로 처리하는 비전-언어 모델이다. 비트 비용으로 시간 구간을 나누고 움직임 잔차로 중요한 공간 증거를 골라, 제한된 토큰을 사건이 많은 부분에 집중한다. 약 800만 개의 재캡션 영상과 400만 개의 공간 학습 샘플을 사용했으며, 이미지와 프레임 및 코덱 캔버스를 공통 3차원 위치 표현에 놓는다. 8B 모델은 JumpScore에서 74.9 mAP를 기록했고 같은 토큰 예산에서 코덱 스트림 입력이 균일 프레임 샘플링보다 시간 위치 찾기를 9.7점 높였다. 이 결과는 영상 코덱의 예측 정보를 장시간 영상 이해와 공간 추론을 위한 선택적 지각 자원 배분에 활용할 수 있음을 보여준다.
핵심 요약
- 3단계(긴 비디오)에서는 모델이 약 800만 개 클립으로 구성되고 총 1,040억 토큰에 달하는 길이 계층화된 비디오 캡션 코퍼스에 노출된다. 이 비디오들은 30초에서 15분까지 다양하며, 모델이 긴 시간 동안 맥락을 유지하도록 학습시킨다.
- 4단계(코덱 및 공간)에서는 코덱 네이티브 학습이 도입된다. 10~15분 길이의 비디오는 가변 길이 GOP 파이프라인을 사용하여 재인코딩된다. 추가로, 모델은 실내 스캔에서 객체를 식별하거나 체화된 시뮬레이터에서 움직임을 추적하는 등 2D 및 3D 공간 추론에 초점을 맞춘 400만 개 샘플을 포함하는 LLaVA-OneVision-2-Spatial-4M 코퍼스로 학습된다.
- 코덱 스트림 접근법은 시간적 그라운딩과 시각 인식에서 현저히 더 우수했다. '이벤트를 담은' 순간에 토큰을 재할당함으로써, 균일 샘플링이 놓치는 움직임 역학을 포착한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.