Parallel Decoding Distillation for Fast Image and Video Generation

발행일
출처
arXiv
논문 번호
753
분야
Computer Vision
arXiv 번호
2607.26004

이 논문은 비디오/이미지 생성 모델의 속도를 크게 높이면서도 다양성은 유지하는 간단한 증류 방법(PDD)을 제안한 NVIDIA의 연구다.

이 논문은 한마디로 확산/플로우 모델을 몇 단계만에 생성할 수 있게 하는 간단하고 확장 가능한 증류 방법을 제안했다. 핵심은 한 번의 네트워크 계산으로 여러 디노이징 스텝을 병렬로 예측하는 '병렬 디코더'를 훈련시키는 것이다. 기존 방식(VSD, 적대 손실)은 모드 붕괴로 비디오 다양성이 떨어지지만, PDD는 단순 회귀 목적만으로 다양성을 유지한다. Wan2.1 14B, Qwen-Image 20B, LTX-2.3 22B 등 대규모 모델에서 SOTA 성능을 달성했다.

핵심 요약

  • 한 번의 순전파로 여러 디노이징 스텝을 병렬 예측하는 '병렬 디코더'를 훈련시켜 생성 속도를 높였다.
  • VSD나 GAN 손실 없이 단순 회귀 목적만 사용해서 모드 붕괴(다양성 상실) 문제를 해결했다.
  • Wan2.1 14B 텍스트-투-비디오에서 VBench 1위, 다양성 지표에서도 기준선 대비 우수했다.
  • Qwen-Image 20B에서 4-8 NFE만으로 SOTA 점수를 달성했다.
  • LTX-2.3 22B 모델에서 720p 10초 비디오+오디오를 8 NFE만에 생성 가능하다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)