Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
- 발행일
- 출처
- arXiv
- 논문 번호
- 873
- 분야
- Computer Vision
- arXiv 번호
- 2608.09873
이 논문은 과학 분야 비디오 생성 모델이 시각적 품질은 좋아도 과학적 정확성이 떨어진다는 것을 보여주는 벤치마크(Sci-VBench)를 만들었다. 60개 과목, 1,253개 전문가 주석 예제로 평가한다.
이 논문은 한마디로 비디오 생성 모델이 '그럴듯해 보이는' 영상은 만들 수 있어도, '과학적으로 맞는' 영상을 만드는지는 다른 문제라는 걸 체계적으로 평가했다. 4개 학문 분야, 60개 과목, 1,253개 전문가 주석 예제로 구성된 Sci-VBench를 만들고, 16개 모델을 평가했다. 시각적 품질 점수는 비슷하지만 과학적 인과 정확성에서는 큰 차이가 났고, 특히 상용 모델과 오픈소스 모델 사이에 현격한 격차가 있었다.
핵심 요약
- 4개 학문 분야(자연과학, 의료, 인문사회, 공학) 60개 과목의 1,253개 전문가 주석 비디오 생성 과제를 구축했다.
- 전문가 작성 평가 루브릭과 단계별 채점 기준(1-5점)을 모든 예제에 제공했다.
- 비전문가 평가자도 루브릭을 받으면 전문가와 높은 일치(Cohen's κ = 0.842)를 보였다.
- 16개 프론티어 모델 평가 결과 시각 품질은 비슷하지만 과학적 정확성에서 큰 격차를 발견했다.
- 프롬프트 개선으로 일부 향상되지만 시공간 일관성 한계는 생성기 자체의 문제임을 밝혔다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.