LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation

발행일
출처
arXiv
논문 번호
300
분야
Computer Vision
arXiv 번호
2606.02553

자기회귀(AR) 비디오 확산은 가변 길이 합성을 가능하게 하지만, 장기 시간 지평 생성은 종종 누적 오류와 정체성 표류에 시달린다.

자기회귀 영상 생성기는 최근 구간만 보는 창 방식 때문에 긴 영상을 만들수록 외형 오류와 정체성 변화가 누적된다. LongLive-RAG는 이미 생성한 잠재 표현 전체를 검색 가능한 기억으로 두고, 다음 구간마다 관련 있는 과거 내용을 찾아 조건으로 다시 넣는다. 윈도우 시간 델타 손실은 바로 옆 구간의 중복된 유사성은 줄이고 의미 있는 시간 변화를 담는 검색 표현을 학습한다. 여러 자기회귀 백본과 영상 길이에서 작은 검색 비용만 더하면서 긴 영상 품질을 높였고 VBench-Long에서 가장 좋은 평균 순위를 기록했다. 다만 생성기 자체는 고정돼 있어 최종 품질은 바탕 영상 모델의 능력과 오류 한계를 넘을 수 없다.

핵심 요약

  • 검색을 더 변별력 있게 만들기 위해, 저자들은 중복된 국소 유사성을 억제하고 임베딩이 의미 있는 시간적 변화를 포착하도록 장려하는 윈도우 시간 델타 손실(Window Temporal Delta Loss)을 도입한다.
  • 여러 AR 백본과 생성 길이에 걸친 실험은 향상된 장편 비디오 품질과 최고의 평균 VBench-Long 순위를 보여준다.
  • 알려진 한, 개방형 AR 장편 비디오 생성 방법 중에서 LongLive-RAG는 자체 생성된 잠재 이력을 콘텐츠 주소 지정 가능 검색 메모리로 정식화한 최초의 방법이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)