Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
- 발행일
- 출처
- arXiv
- 논문 번호
- 659
- 분야
- Computer Vision
- arXiv 번호
- 2607.16107
긴 영상에서 영상과 소리를 같이 이해하는 멀티모달 LLM이다. 15개 이상 벤치마크에서 동급 최고 성능을 기록했다.
이 논문은 한마디로 길고 복잡한 실제 영상에서 화면과 소리를 함께 이해하고 추론하는 오픈소스 멀티모달 LLM이다. 약 700만 개의 캡션·QA 데이터셋(AV-Skills)을 구축하고, 3단계 커리큘럼으로 학습시켰다. TAVIT라는 시간 기반 사고 사슬(reasoning chain)을 도입해 추론 과정을 영상 타임스탬프에 정확히 연결한다. 15개 이상 벤치마크에서 비슷한 크기의 오픈 모델을 뛰어넘었고, 일부에서는 클로즈드 모델도 추월했다.
핵심 요약
- 약 700만 캡션·QA 인스턴스로 구성된 AV-Skills 데이터셋을 공개했다.
- 짧은 영상 인식에서 긴 영상(최대 15분) 추론까지 단계적으로 학습하는 3단계 커리큘럼을 설계했다.
- TAVIT로 추론 중간 단계를 영상/오디오 타임스탬프에 정확히 매핑했다.
- MMOU에서 60.2%로 동급 오픈소스 최고 성능을 기록했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.