You Only Index Once: Cross-Layer Sparse Attention with Shared Routing

발행일
출처
arXiv
논문 번호
339
분야
LLMs / NLP
arXiv 번호
2606.06467

KV 공유 아키텍처에서 라우팅 인덱스까지 레이어 간 공유해 128K 컨텍스트에서 최대 7.6배 디코딩 가속을 달성한다.

CLSA(Cross-Layer Sparse Attention)는 YOCO 등 KV 공유 아키텍처 위에 구축되어, KV 캐시뿐 아니라 라우팅 인덱스까지 레이어 간에 공유한다. 단일 인덱서가 토큰 수준 top-k 선택을 한 번 수행하고 그 결과를 모든 층에서 재사용해, 토큰 희소 attention의 세밀한 선택성을 유지하면서 라우팅 오버헤드를 분할 상환한다. 프리필링, KV 캐시 저장, 장문맥 디코딩 등 모든 주요 추론 병목을 개선하며, 128K 컨텍스트에서 최대 7.6배 디코딩 가속과 17.1배 전체 처리량 향상을 달성한다.

핵심 요약

  • KV 공유 아키텍처에서 라우팅 인덱스까지 레이어 간 공유하는 CLSA를 제안한다.
  • 단일 인덱서가 top-k 선택을 한 번 수행하고 결과를 전체 층에서 재사용한다.
  • 토큰 희소 attention의 정확도를 유지하면서 라우팅 비용을 분할 상환한다.
  • 프리필링, KV 캐시, 디코딩 등 모든 주요 추론 병목을 동시에 개선한다.
  • 128K 컨텍스트에서 7.6배 디코딩 가속, 17.1배 전체 처리량 향상을 달성한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)