Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
- 발행일
- 출처
- arXiv
- 논문 번호
- 033
- 분야
- Architecture / Efficiency
- arXiv 번호
- 2502.11089
DeepSeek-AI 연구진은 대규모 언어 모델을 위한 효율적이고 성능 좋은 긴 컨텍스트 모델링을 가능하게 하는, 하드웨어 정렬형이며 네이티브하게 학습 가능한 희소 어텐션 메커니즘 Native Sparse Attention(NSA)을 개발했다.
DeepSeek-AI 연구진은 대규모 언어 모델을 위한 효율적이고 성능 좋은 긴 컨텍스트 모델링을 가능하게 하는, 하드웨어 정렬형이며 네이티브하게 학습 가능한 희소 어텐션 메커니즘 Native Sparse Attention(NSA)을 개발했다. NSA는 64k 컨텍스트 길이에서 최대 11.6배의 디코딩 속도 향상과 9.0배의 학습 속도 향상을 달성하는 동시에, 긴 컨텍스트 추론 작업을 포함한 다양한 벤치마크에서 full attention을 능가한다.
핵심 요약
- LLM의 전통적인 어텐션 메커니즘은 시퀀스 길이에 대해 이차 연산 복잡도를 가져, 학습과 추론 시 긴 컨텍스트 처리가 엄청나게 비싸진다.
- 기존 희소 어텐션 방법은 비효율적인 메모리 접근 패턴과 현대 하드웨어 구조(예: MQA/GQA)와의 비호환성 탓에, 이론적 효율 이득을 실제 지연 속도 향상으로 전환하지 못하는 경우가 많다.
- 대부분의 희소 어텐션 접근법은 추론 전용으로 설계되어 사전 학습된 full attention 백본을 요구하는데, 이는 성능 저하로 이어지거나 종단간 학습을 비실용적이거나 비효율적으로 만들 수 있다.
- Native Sparse Attention(NSA)은 세 개의 병렬 분기를 결합한 계층적 희소 어텐션 메커니즘을 도입한다. 즉 전역 컨텍스트를 위한 압축 어텐션, 세밀하게 중요한 토큰을 위한 선택 어텐션, 지역 컨텍스트를 위한 슬라이딩 윈도우 어텐션이다.
- 학습 가능한 게이팅 메커니즘을 사용해 이 분기들의 출력을 동적으로 집계함으로써, 높은 희소성을 유지하면서 거친 정보와 세밀한 정보를 유연하게 결합할 수 있게 한다.
- NSA는 하드웨어 정렬을 위해 설계된 전용 Triton 기반 커널을 활용하며, 그룹 중심 데이터 로딩과 공유 KV 페칭에 초점을 맞춰 학습과 추론 모두에서 메모리 접근을 최적화하고 GPU 텐서 코어 활용도를 극대화한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.