GraphVid: Interactive Graph-Controllable Video Generation

발행일
출처
arXiv
논문 번호
718
분야
Computer Vision
arXiv 번호
2607.21580

장면 그래프(scene graph)를 조건으로 삼아 한 장의 사진에서 여러 객체의 상호작용을 제어하며 영상을 만드는 비디오 생성 모델이다.

이 논문은 한마디로 "그래프로 영상 움직임을 조종하는" 새로운 비디오 생성 방법을 제안한다. 기존 방식은 객체마다 궤적을 그려주거나 텍스트로 설명해야 해서 여러 객체가 얽히는 장면에서는 쓰기 어려웠다. GraphVid는 이미지에서 객체와 관계를 자동으로 그래프로 만들고, 사용자가 이 그래프를 수정하면 그 정보가 비디오 생성 모델에 주입되어 자연스러운 영상이 만들어진다. 적은 데이터(약 2.7만 클립)와 적은 파라미터(0.6B)로도 기존 방법보다 훨씬 좋은 품질을 보였다.

핵심 요약

  • 장면 그래프(객체=노드, 상호작용=엣지)를 조건으로 비디오를 생성하는 최초의 프레임워크를 제안했다.
  • Edge-Aware Graph Reasoning 모듈로 방향성 엣지 속성을 반영하여 메시지 전달을 수행한다.
  • GraphVid-Bench라는 약 27K 상호작용 중심 비디오 데이터셋을 새로 구축했다.
  • Motion-I2V 대비 FID 39.9% 감소, FVD 37.6% 감소, PSNR 9.87→15.98 향상을 달성했다.
  • 학습 가능한 파라미터 0.6B로 기존 방법(수십억 파라미터) 대비 훨씬 효율적이다.
  • 그래프 표현이 백본 모델에 독립적이라 LTX(2B)와 Wan 2.2(5B) 모두에서 효과를 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)