Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 344
- 분야
- AI / General
- arXiv 번호
- 2606.06453
희소 attention 알고리즘을 빠르게 프로토타이핑하고 배포하는 프로그래밍 가능한 서빙 시스템으로 최대 4.7배 가속을 달성한다.
Vortex는 Python 임베디드 프론트엔드 언어와 페이지 중심 텐서 추상화 위에 구축된 희소 attention 서빙 시스템이다. 다양한 희소 attention 알고리즘을 표현할 수 있고, 효율적인 백엔드가 현대 LLM 서빙 스택과 긴밀히 통합된다. AI 에이전트가 Vortex를 사용해 자동으로 다양한 알고리즘을 생성하고 정제하며, 최적 결과는 full attention 대비 3.46배 높은 처리량을 달성한다. 또한 GLM-4.7-Flash에서 4.7배, 229B 파라미터 MiniMax-M2.7에서 1.37배 처리량 향상을 기록하며, 신흥 아키텍처와 초대형 모델까지 확장 가능함을 보여준다.
핵심 요약
- Python 임베디드 프론트엔드로 희소 attention 알고리즘을 빠르게 프로토타이핑할 수 있다.
- AI 에이전트가 자동으로 알고리즘을 생성하고 정제해 3.46배 처리량 향상을 달성한다.
- GLM-4.7-Flash MLA 아키텍처에서 4.7배, MiniMax-M2.7 229B에서 1.37배 가속한다.
- 현대 LLM 서빙 스택과 긴밀히 통합된 효율적 백엔드를 제공한다.
- 신흥 아키텍처와 초대형 모델까지 희소 attention의 적용 범위를 확장한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.