Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

발행일
출처
arXiv
논문 번호
659
분야
Computer Vision
arXiv 번호
2607.16107

긴 영상에서 영상과 소리를 같이 이해하는 멀티모달 LLM이다. 15개 이상 벤치마크에서 동급 최고 성능을 기록했다.

이 논문은 한마디로 길고 복잡한 실제 영상에서 화면과 소리를 함께 이해하고 추론하는 오픈소스 멀티모달 LLM이다. 약 700만 개의 캡션·QA 데이터셋(AV-Skills)을 구축하고, 3단계 커리큘럼으로 학습시켰다. TAVIT라는 시간 기반 사고 사슬(reasoning chain)을 도입해 추론 과정을 영상 타임스탬프에 정확히 연결한다. 15개 이상 벤치마크에서 비슷한 크기의 오픈 모델을 뛰어넘었고, 일부에서는 클로즈드 모델도 추월했다.

핵심 요약

  • 약 700만 캡션·QA 인스턴스로 구성된 AV-Skills 데이터셋을 공개했다.
  • 짧은 영상 인식에서 긴 영상(최대 15분) 추론까지 단계적으로 학습하는 3단계 커리큘럼을 설계했다.
  • TAVIT로 추론 중간 단계를 영상/오디오 타임스탬프에 정확히 매핑했다.
  • MMOU에서 60.2%로 동급 오픈소스 최고 성능을 기록했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)