SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

발행일
출처
arXiv
논문 번호
699
분야
Computer Vision
arXiv 번호
2607.21553

비디오 생성 모델에서 선형 어텐션(빠르지만 표현력이 떨어지는 방식)과 소프트맥스 어텐션(느리지만 정확한 방식)을 3:1로 섞어서, 속도와 품질을 동시에 잡은 하이브리드 비디오 생성 기법이다.

이 논문은 한마디로 비디오를 만들 때 계산량이 많은 소프트맥스 어텐션을 25%만 쓰고 나머지는 가벼운 선형 어텐션으로 대체해서, 품질은 비슷하게 유지하면서 속도를 크게 높인 방법이다. 선형 어텐션(데이터를 순차적으로 빠르게 처리하는 기술) 3개마다 소프트맥스 어텐션(정밀하게 모든 데이터 간 관계를 계산하는 기술) 1개를 배치해서 정확도를 보완했다. 추가로 AttnRes(블록 어텐션 잔차)라는 기법으로 깊은 층에서 정보가 희석되는 문제를 해결했다. 5B 모델 기준 H100 GPU 한 대에서 720p 비디오를 13초 만에 생성하며, 비슷한 크기의 기존 모델보다 3.2배 빠르다.

핵심 요약

  • 선형 어텐션과 소프트맥스 어텐션을 3:1 비율로 섞어 속도와 품질을 동시에 잡았다.
  • AttnRes 기법으로 깊은 층의 정보 품질이 약 12% 향상되었다.
  • H100 GPU 한 대로 720p 비디오를 13초에 생성한다 (기존 Wan 2.2 대비 120배 빠름).
  • 소프트맥스 25%가 품질과 효율의 최적 균형점임을 처음부터 직접 학습하며 확인했다.
  • 커널 최적화(Sol-Engine)로 추가 3.58배 가속을 달성했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)