FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring
- 발행일
- 출처
- arXiv
- 논문 번호
- 765
- 분야
- Computer Vision
- arXiv 번호
- 2607.27110
주파수 도메인 자기 닻줄 기법으로 5초 학습 모델을 2분 영상까지 안정적으로 확장하는 비디오 생성 프레임워크.
이 논문은 한마디로 짧은 비디오(5초)만 학습한 모델을 추가 학습 없이 2분까지 안정적으로 늘리는 방법이다. 자기회귀 비디오 생성에서 오류가 누적되는 현상을 주파수 도메인에서 분석했더니, 저주파(색상·구조) 에너지가 흘러가는 것이 원인이었다. FreqForcing은 초기 고품질 프레임의 저주파를 닻(anchor)으로 써서 드리프트를 잡고, 고주파(움직임·디테일)는 최신 프레임에서 가져와 다이나믹스를 보존한다.
핵심 요약
- 자기회귀 비디오 생성의 오류 누적을 주파수 도메인에서 분석해 저주파 에너지 드리프트가 원인임을 밝혔다.
- Spectral Self-Anchoring(SSA)로 초기 프레임의 저주파 + 최신 프레임의 고주파를 융합해 안정성과 다이나믹스를 동시에 확보했다.
- 추가 학습 없이 5초 학습 모델을 2분(24배 확장)까지 안정적으로 생성할 수 있다.
- VBench-Long 메트릭에서 기존 training-free 방법들을 능가하고, training-based 방법과도 경쟁력 있는 성능을 보였다.
- 추론 속도는 Self-Forcing 대비 약 16.5%만 증가하는 가벼운 오버헤드다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.