VideoRAG: Retrieval-Augmented Generation over Video Corpus
- 발행일
- 출처
- arXiv
- 논문 번호
- 018
- 분야
- RAG / Video
- arXiv 번호
- 2501.05874
KAIST 연구진은 코퍼스에서 관련 동영상을 동적으로 검색하고 그 시각·텍스트 콘텐츠를 통합적으로 활용해 응답을 생성하는 검색 증강 생성(RAG) 프레임워크 VideoRAG를 개발했다.
KAIST 연구진은 코퍼스에서 관련 동영상을 동적으로 검색하고 그 시각·텍스트 콘텐츠를 통합적으로 활용해 응답을 생성하는 검색 증강 생성(RAG) 프레임워크 VideoRAG를 개발했다. 이 접근은 Large Video Language Model의 출력을 포괄적이고 동적인 동영상 지식에 성공적으로 정초시켜, 질의응답 과제에서 텍스트 기반 및 정적 이미지 RAG 베이스라인을 능가하고 사실적으로 더 정확하며 맥락적으로 풍부한 답변을 산출한다.
핵심 요약
- 대규모 언어 모델과 대규모 비전-언어 모델은 파라메트릭 지식에 의존하는 탓에 사실과 다르거나 시대에 뒤떨어진 정보를 빈번히 생성한다.
- 기존 검색 증강 생성(RAG)은 주로 텍스트 데이터에 초점을 두고 정적 이미지는 제한적으로만 포함하며, 동영상은 흔히 텍스트로 변환해 시간적 동역학과 시각적 맥락 같은 풍부한 멀티모달 정보를 잃는다.
- 긴 동영상은 연산상 실현 불가능성과 제한된 맥락 창 때문에 LVLM에 도전 과제가 되며, 많은 동영상에는 자막 같은 연관 텍스트 정보가 없다.
- VideoRAG는 질의와 동영상(프레임과 자막 사용)을 모두 LVLM으로 임베딩하고 코사인 유사도로 상위 k개의 관련 동영상을 선택하여, 대규모 코퍼스에서 동적 동영상 검색을 구현한다.
- 응답 생성을 위해, 프레임워크는 선택된 동영상 프레임과 연관 텍스트(자막 또는 생성된 보조 텍스트)를 사용자 질의와 연결하여, 이 포괄적인 멀티모달 입력을 LVLM에 투입한다.
- k-means++ 클러스터링을 적용한 적응형 프레임 선택 메커니즘이 가장 유익하고 중복되지 않는 동영상 프레임을 식별하며, 자막이 없을 때는 ASR을 사용해 오디오 트랙에서 보조 텍스트를 생성한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.