Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

발행일
출처
arXiv
논문 번호
731
분야
Computer Vision
arXiv 번호
2607.24027

재학습 없이 어텐션만 희소화해 영상 생성 추론을 2배 넘게 가속하는 실전 기법이다.

긴 토큰 탓에 영상 확산 트랜스포머는 어텐션이 추론 병목이다. Sol-Attn은 블록 프록시 점수가 거의 가우시안인 점을 이용해 쿼리별 임계값으로 블록을 즉석에서 고르고, 프록시 지도를 메모리에 만들지 않는다. 버린 블록 점수는 재활용해 근사 보정하며, 라우팅과 희소 계산과 보정을 온라인 소프트맥스 한 번에 합친다. 영상 생성 2.1배, 편집 2.3배 가속에 Sol-Engine 통합 시 최대 5배까지 빨라지며 화질을 유지한다.

핵심 요약

  • 학습 없이 어텐션만 희소화해 사전학습 모델을 그대로 가속한다.
  • 블록 프록시 점수가 가우시안이라 평균과 표준편차 기반 임계값으로 블록을 고른다.
  • 프록시 점수 지도를 메모리에 만들지 않아 라우팅 비용을 줄인다.
  • 버린 블록 점수를 재활용해 근사 보정하므로 공격적 희소화에도 정확도 손실이 작다.
  • 영상 생성 2.1배, 편집 2.3배 종단 가속을 화질 저하 없이 낸다.
  • Sol-Engine과 통합하면 영상 생성에서 최대 5배 가속에 도달한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)