Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

발행일
출처
arXiv
논문 번호
918
분야
Computer Vision
arXiv 번호
2608.14391

현재의 위기 영상 탐지기는 생성기나 게시 방식이 바뀌면 성능이 크게 흔들린다는 점을 체계적으로 보여준 연구다.

이 논문은 한마디로 실제 위기 영상과 합성 영상을 짝지은 RA-Bench를 만들고, 탐지기가 현실적인 변화에 얼마나 버티는지 평가한다. 자료는 10개 사회 위험 범주의 실제 영상 1,830개와 9개 생성기가 만든 영상 16,056개다. 기존 탐지기와 멀티모달 모델은 생성 모델과 입력 조건이 달라지자 성능이 크게 흔들렸다. 특히 사람이 진짜라고 본 생성 영상과 압축, 축소, 프레임 감소를 거친 영상에서 탐지 실패가 늘었다. 실험은 소리 없는 이미지 기반 생성 영상에 한정된다는 점도 주의해야 한다.

핵심 요약

  • RA-Bench는 실제 영상 1,830개와 생성 영상 16,056개를 합친 17,886개 영상으로 구성된다. 실제 영상은 10개 사회 위험 범주를 다룬다.
  • 전통 탐지기 7개의 공개 자료상 AUC는 67.6퍼센트에서 98.6퍼센트였다. RA-Bench의 생성기별 평균은 43.9퍼센트에서 57.3퍼센트에 그쳤다.
  • 사람은 오픈소스 생성 영상의 68.6퍼센트를 합성으로 알아봤지만 비공개 생성기 영상은 52.9퍼센트만 알아봤다. 다섯 명 모두 진짜라고 판단한 생성 영상도 633개였다.
  • 압축, 화면 축소, 초당 프레임 감소와 뉴스 배지를 모두 적용하자 추가 학습된 멀티모달 탐지기의 평균 생성 영상 탐지율이 46.0퍼센트에서 1.4퍼센트로 떨어졌다.
  • 실험은 9개 이미지 기반 영상 생성기와 소리 없는 영상 탐지에 한정된다. 실제 허위 정보에는 음성 합성, 편집과 여러 플랫폼의 반복 처리도 함께 쓰일 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)