LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

발행일
출처
arXiv
논문 번호
1006
분야
Computer Vision
arXiv 번호
2608.24845

이 논문은 CommonCrawl에서 모은 영상 링크로 1,000만 시간 규모의 공개 영상 데이터셋을 만들고, 영상과 소리와 이미지 세 갈래 학습 모두에서 쓸 만한 학습 신호가 나온다는 것을 보였다.

이 논문은 한마디로 '초대형 공개 영상 데이터셋 만들기'다. 연구진은 CommonCrawl 기록에서 영상 링크 13억 개를 골라내고, 그중 8,000만 개를 실제로 내려받아 총 1,000만 시간 분량을 모았다. 장면이 바뀌는 지점을 찾아 짧은 조각으로 자른 뒤, 작은 인공지능 모델로 영상 설명문과 소리 설명문을 자동으로 붙였다. 이 데이터로 학습한 영상 모델은 같은 조건의 InternVid 기반 모델보다 나은 점수를 냈고, 소리 모델은 LAION-Audio와 비슷하거나 더 좋았다. 영상에서 뽑은 정지 장면으로 학습한 이미지 모델은 검색 과제에 강했지만 ImageNet 분류에서는 기존 웹 이미지 데이터보다 약했다. 저자들은 이 데이터셋을 연구 커뮤니티에 공개한다고 밝혔다.

핵심 요약

  • CommonCrawl 기록에서 유튜브와 비메오와 데일리모션 링크만 걸러 13억 개를 만든 뒤 8,000만 개를 실제로 내려받아 1,000만 영상 시간을 확보했다.
  • 이 가운데 영상 240만 개를 뽑아 장면 전환 기준으로 5,500만 개 조각으로 자르고, Qwen3-VL-2B-Instruct로 영상 설명을, Audio Flamingo 3로 소리 설명을 자동으로 붙였다.
  • 학습 표본 5,000만 개를 본 시점에서 BVD-V-10M과 BVD-V-50M은 더 촘촘히 걸러진 InternVid-10M-FLT보다 종합 평균이 각각 3.3점과 4.0점 높았다.
  • 영상과 소리와 이미지를 한 자리에서 다룰 수 있는 공개 자원이라, 검색이나 표현 학습처럼 임베딩 품질이 중요한 작업에 바로 쓸 만하다.
  • 다만 설명문이 모두 작은 모델로 짧게 자동 생성돼 표현이 빈약하고 모델 편향이 섞일 수 있으며, 실제로 ImageNet 분류 점수는 기존 웹 이미지 데이터보다 낮았다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)