MiniMax Sparse Attention
- 발행일
- 출처
- arXiv
- 논문 번호
- 403
- 분야
- AI / General
- arXiv 번호
- 2606.13392
MiniMax가 GQA 기반 블록 단위 희소 어텐션(MSA)을 제안. 경량 Index Branch가 Top-k 블록을 선택하고 Main Branch가 선택된 블록만 어텐션을 수행해, 109B MoE 모델에서 GQA와 동등한 성능을 유지하면서 1M 컨텍스트에서 어텐션 연산량을 28.4배, 실제 속도는 prefill 14.2배/decoding 7.6배 향상시켰다.
MSA는 Grouped Query Attention(GQA) 위에 구축된 블록 단위 희소 어텐션 메커니즘이다. 핵심은 경량 Index Branch가 각 GQA 그룹별로 Top-k 키 블록을 독립적으로 선택하고, Main Branch가 선택된 블록에 대해서만 정확한 어텐션을 수행하는 것. 109B 파라미터 MoE 모델에서 3T 토큰으로 처음부터 학습하여 검증했으며, 다운스트림 벤치마크에서 GQA와 동등한 성능을 보이면서도 1M 토큰 컨텍스트에서 토큰당 어텐션 연산을 28.4배 감소시켰다. H800 GPU에서 prefill 14.2배, decoding 7.6배 실제 속도 향상을 달성했고, 추론 커널을 오픈소스로 공개했다.
핵심 요약
- GQA 기반 블록 희소 어텐션: 각 GQA 그룹별로 경량 Index Branch가 Top-k 블록을 독립 선택
- 109B MoE 모델에서 3T 토큰 from-scratch 학습으로 GQA와 동등한 다운스트림 성능 입증
- 1M 컨텍스트에서 토큰당 어텐션 FLOPs 28.4배 감소, H800에서 prefill 14.2배·decoding 7.6배 속도 향상
- exp-free TopK 커널과 KV-outer 희소 어텐션으로 GPU 텐서코어 활용률 최적화
- KL 정렬 손실로 Index Branch를 훈련하고 stop-gradient로 Main Branch와 분리
- MiniMax-M3라는 상용 멀티모달 모델로 공개 배포 (HuggingFace)
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.