MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation

발행일
출처
arXiv
논문 번호
379
분야
Computer Vision
arXiv 번호
2606.09056

비디오 생성의 장기 일관성 문제를 계층적 latent 공간에서 coarse-to-fine rollout으로 해결하는 MilliVid를 제안했다. Minecraft 장기 비디오에서 기존 대비 현저히 개선된 장거리 일관성을 보여준다.

MilliVid는 비디오 생성의 장기 일관성 문제를 고정 transformer 시퀀스 길이 하에서 해결한다. 먼저 프레임을 계층적 토큰으로 압축하는 autoencoder를 학습한다. coarsest 레벨은 프레임당 4개 토큰으로 장면 구조와 의미를 포착하고, finer 레벨은 텍스처와 외관 디테일을 추가한다. 이어서 coarse-to-fine rollout으로 비디오를 생성하는데, coarse 레벨에서 많은 프레임을 커버해 장기 구조 일관성을 확보한 뒤 점진적으로 fine 레벨로 디테일을 채운다. Minecraft 긴 비디오 데이터셋에서 FramePack 및 기존 autoregressive 방법 대비 현저히 우수한 장기 일관성을 달성한다. 단순 다운샘플링이 아닌 학습된 계층적 토큰화가 핵심이다.

핵심 요약

  • 프레임당 토큰 수가 계층별로 다른 hierarchical autoencoder 설계
  • Coarsest 레벨(4토큰/프레임)에서 장면 구조와 객체 영속성 포착
  • Coarse-to-fine rollout으로 고정 시퀀스 길이 내 최대 시간적 커버리지 확보
  • 학습된 계층적 토큰화가 단순 다운샘플링보다 우수한 압축 품질
  • 멀리 미래를 예측하도록 모델을 훈련해 장기 context 의존성 유도
  • Minecraft 장기 비디오에서 FramePack 대비 현저한 일관성 개선

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)