You Only Index Once: Cross-Layer Sparse Attention with Shared Routing
- 발행일
- 출처
- arXiv
- 논문 번호
- 339
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.06467
KV 공유 아키텍처에서 라우팅 인덱스까지 레이어 간 공유해 128K 컨텍스트에서 최대 7.6배 디코딩 가속을 달성한다.
CLSA(Cross-Layer Sparse Attention)는 YOCO 등 KV 공유 아키텍처 위에 구축되어, KV 캐시뿐 아니라 라우팅 인덱스까지 레이어 간에 공유한다. 단일 인덱서가 토큰 수준 top-k 선택을 한 번 수행하고 그 결과를 모든 층에서 재사용해, 토큰 희소 attention의 세밀한 선택성을 유지하면서 라우팅 오버헤드를 분할 상환한다. 프리필링, KV 캐시 저장, 장문맥 디코딩 등 모든 주요 추론 병목을 개선하며, 128K 컨텍스트에서 최대 7.6배 디코딩 가속과 17.1배 전체 처리량 향상을 달성한다.
핵심 요약
- KV 공유 아키텍처에서 라우팅 인덱스까지 레이어 간 공유하는 CLSA를 제안한다.
- 단일 인덱서가 top-k 선택을 한 번 수행하고 결과를 전체 층에서 재사용한다.
- 토큰 희소 attention의 정확도를 유지하면서 라우팅 비용을 분할 상환한다.
- 프리필링, KV 캐시, 디코딩 등 모든 주요 추론 병목을 동시에 개선한다.
- 128K 컨텍스트에서 7.6배 디코딩 가속, 17.1배 전체 처리량 향상을 달성한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.