Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation

발행일
출처
arXiv
논문 번호
495
분야
Computer Vision
arXiv 번호
2606.23743

Sol Video Inference Engine은 비디오 디퓨전 모델을 위한 에이전트 네이티브 훈련 없는 전체 스택 가속화 프레임워크로 2배 이상의 엔드투엔드 가속을 달성한다.

Sol Video Inference Engine은 캐싱, 희소 어텐션, 토큰 프루닝, 양자화, 커널 퓨전의 다섯 가지 기술을 에이전트 가속화 스택으로 조직한다. Cosmos3-Super(64B), LTX-2.3(22B), SANA-Video(2B) 세 가지 비디오 모델에 적용하여 VBench 품질을 거의 손실 없이 2배 이상의 엔드투엔드 가속을 달성한다. 인간 노력을 최소화하여 인스턴스별 최적화를 자동화한다.

핵심 요약

  • Sol Video Inference Engine은 캐싱, 희소 어텐션, 토큰 프루닝, 양자화, 커널 퓨전의 다섯 가지 기술을 에이전트 가속화 스택으로 조직한다
  • Cosmos3-Super(64B), LTX-2.3(22B), SANA-Video(2B) 세 가지 비디오 모델에 적용하여 VBench 품질을 거의 손실 없이 2배 이상의 엔드투엔드 가속을 달성한다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)