SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 699
- 분야
- Computer Vision
- arXiv 번호
- 2607.21553
비디오 생성 모델에서 선형 어텐션(빠르지만 표현력이 떨어지는 방식)과 소프트맥스 어텐션(느리지만 정확한 방식)을 3:1로 섞어서, 속도와 품질을 동시에 잡은 하이브리드 비디오 생성 기법이다.
이 논문은 한마디로 비디오를 만들 때 계산량이 많은 소프트맥스 어텐션을 25%만 쓰고 나머지는 가벼운 선형 어텐션으로 대체해서, 품질은 비슷하게 유지하면서 속도를 크게 높인 방법이다. 선형 어텐션(데이터를 순차적으로 빠르게 처리하는 기술) 3개마다 소프트맥스 어텐션(정밀하게 모든 데이터 간 관계를 계산하는 기술) 1개를 배치해서 정확도를 보완했다. 추가로 AttnRes(블록 어텐션 잔차)라는 기법으로 깊은 층에서 정보가 희석되는 문제를 해결했다. 5B 모델 기준 H100 GPU 한 대에서 720p 비디오를 13초 만에 생성하며, 비슷한 크기의 기존 모델보다 3.2배 빠르다.
핵심 요약
- 선형 어텐션과 소프트맥스 어텐션을 3:1 비율로 섞어 속도와 품질을 동시에 잡았다.
- AttnRes 기법으로 깊은 층의 정보 품질이 약 12% 향상되었다.
- H100 GPU 한 대로 720p 비디오를 13초에 생성한다 (기존 Wan 2.2 대비 120배 빠름).
- 소프트맥스 25%가 품질과 효율의 최적 균형점임을 처음부터 직접 학습하며 확인했다.
- 커널 최적화(Sol-Engine)로 추가 3.58배 가속을 달성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.