Self Gradient Forcing: Native Long Video Extrapolation
- 발행일
- 출처
- arXiv
- 논문 번호
- 690
- 분야
- Computer Vision
- arXiv 번호
- 2607.20368
비디오 생성 모델이 긴 영상을 만들 때 중간에 화면이 튀거나 인물이 변하는 문제를, '메모리 쓰기' 단계까지 학습시켜 해결한 논문이다.
이 논문은 한마디로 AI 비디오 생성에서 '역사적 문맥 기울기 갭'이라는 근본 문제를 찾아내고, 2패스 훈련으로 해결한 것이다. 기존 Self Forcing 방식은 자기가 만든 영상을 맥락으로 쓰면서 노출 편향을 줄였지만, 과거 프레임을 메모리에 어떻게 저장하는지까지는 학습하지 못했다. SGF는 미래 프레임의 손실이 과거 맥락의 KV 메모리 쓰기 방식까지 교정하도록 만들어서, 5초 훈련 영상만으로도 수분 길이의 일관된 비디오를 생성할 수 있게 했다.
핵심 요약
- Self Forcing의 치명적 약점인 '과거 맥락 기울기 갭'을 처음으로 정의하고 해결했다.
- 2패스 전략(패스1: 롤아웃 기록, 패스2: 병렬 기울기 복원)으로 메모리 오버헤드 없이 문제를 해결했다.
- 5초 훈련 영상만으로 240초까지 일관된 장영상 생성이 가능하다 (피사체 정체성, 배경 일관성, 시간 안정성 모두 향상).
- 사용자 연구에서 모든 설정에서 Self Forcing보다 선호도가 높았다 (GSB 29.6%~48.7%).
- 피크 메모리 증가가 8GB에 불과하고, 학습 속도 저하도 13% 수준으로 실용적이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.