Watch, Remember, Reason: Human-View Video Understanding with MLLMs

발행일
출처
arXiv
논문 번호
369
분야
Computer Vision
arXiv 번호
2606.07433

비디오 이해를 보기, 기억하기, 추론하기 세 가지 핵심 능력으로 체계화한 종합 서베이로, MLLM 기반 비디오 시스템의 전 영역을 통합 프레임워크로 정리한다.

이 서베이는 MLLM 기반 비디오 이해를 인간 관점에서 보기, 기억하기, 추론하기 세 가지 핵심 기능 능력으로 체계화한다. 보기는 미세한 시공간 지각, 종합 지각, 시청각 지각, 효율적 처리를 다루고, 기억하기는 오프라인 및 스트리밍 메모리 메커니즘을 포함하며, 추론하기는 텍스트 기반 및 비디오와 함께 생각하기 방법을 에이전트와 비에이전트로 구분하여 다룬다. 자아중심, 스포츠, 의료, 내러티브 등 응용 도메인과 학습 데이터셋, 평가 벤치마크까지 포괄한다.

핵심 요약

  • 비디오 이해를 관찰, 기억, 추론의 기능적 과정으로 정식화하여 지각 표현, 메모리 상태, 추론 트레이스, 최종 예측의 통합 공식을 제안한다
  • 보기 영역에서 미세 지각, 종합 지각, 시청각 지각, 효율적 처리의 4가지 하위 영역을 체계적으로 정리한다
  • 기억에서 오프라인 메모리와 스트리밍 메모리를 구분하여 장비디오의 중복성과 증거 희소성 사이의 긴장을 분석한다
  • 추론에서 에이전트형과 비에이전트형, 텍스트 전용과 비디오 포함 등 다양한 추론 패러다임을 통합 분류한다
  • 자아중심, 스포츠, 지시, 의료, 내러티브 등 5개 응용 도메인과 주요 학습 데이터셋 및 평가 벤치마크를 망라한다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)