LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 300
- 분야
- Computer Vision
- arXiv 번호
- 2606.02553
자기회귀(AR) 비디오 확산은 가변 길이 합성을 가능하게 하지만, 장기 시간 지평 생성은 종종 누적 오류와 정체성 표류에 시달린다.
자기회귀 영상 생성기는 최근 구간만 보는 창 방식 때문에 긴 영상을 만들수록 외형 오류와 정체성 변화가 누적된다. LongLive-RAG는 이미 생성한 잠재 표현 전체를 검색 가능한 기억으로 두고, 다음 구간마다 관련 있는 과거 내용을 찾아 조건으로 다시 넣는다. 윈도우 시간 델타 손실은 바로 옆 구간의 중복된 유사성은 줄이고 의미 있는 시간 변화를 담는 검색 표현을 학습한다. 여러 자기회귀 백본과 영상 길이에서 작은 검색 비용만 더하면서 긴 영상 품질을 높였고 VBench-Long에서 가장 좋은 평균 순위를 기록했다. 다만 생성기 자체는 고정돼 있어 최종 품질은 바탕 영상 모델의 능력과 오류 한계를 넘을 수 없다.
핵심 요약
- 검색을 더 변별력 있게 만들기 위해, 저자들은 중복된 국소 유사성을 억제하고 임베딩이 의미 있는 시간적 변화를 포착하도록 장려하는 윈도우 시간 델타 손실(Window Temporal Delta Loss)을 도입한다.
- 여러 AR 백본과 생성 길이에 걸친 실험은 향상된 장편 비디오 품질과 최고의 평균 VBench-Long 순위를 보여준다.
- 알려진 한, 개방형 AR 장편 비디오 생성 방법 중에서 LongLive-RAG는 자체 생성된 잠재 이력을 콘텐츠 주소 지정 가능 검색 메모리로 정식화한 최초의 방법이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.