Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit
- 발행일
- 출처
- arXiv
- 논문 번호
- 656
- 분야
- AI / General
- arXiv 번호
- 2607.13095
샤오미 MiMo-V2.5의 하이브리드 슬라이딩 윈도우 어텐션 + MoE + 멀티모달 구조를 실제 서비스에서 최고 효율로 끌어올린 전 파이프라인 추론 최적화 사례다.
이 논문은 한마디로 Hybrid SWA(대부분 레이어에서 어텐션을 로컬 윈도우로 제한해 계산량을 ~7배 줄이는 기법)의 이론적 이득을 실제 서비스 환경에서 완전히 현실화한 추론 시스템 최적화 사례다. KVCache를 엄격한 O(W) 저장으로 리팩터링하고, RDMA 기반 분산 캐시(GCache)를 구축하며, 멀티모달 전처리까지 전 파이프라인을 최적화했다. 그 결과 Hybrid SWA + MoE + 멀티모달 복합 구조를 효율적으로 서비스하는 최초의 대규모 프로덕션 시스템을 구축했다.
핵심 요약
- KVCache를 Full Attention용과 SWA용으로 분리해, SWA 저장 공간을 이론 한계인 O(W)까지 압축했다 (기존 대비 ~7배 효율 향상).
- GCache라는 RDMA 기반 분산 캐시 인프라를 구축해, 여러 노드 간 KVCache를 효율적으로 공유한다.
- SWA-aware 프리픽스 캐시 트리를 새로 설계해, 기존 프리픽스 매칭이 SWA 환경에서 발생시키던 정확도 버그를 해결했다.
- GPU 이미지 전처리, 병렬 비디오 디코딩(1시간 영상 156초→23초), 인코더 크로스 요청 배칭 등 멀티모달 파이프라인도 전면 최적화했다.
- MTP(다중 토큰 예측)를 프리필 단계에서도 지원하도록 개선하여, 초기 디코딩 128 토큰에서 2.3배 가속을 달성했다.
- NUMA 충돌 해결만으로도 엔드투엔드 성능이 약 10% 향상되는 등, 시스템 레벨 디테일이 성능에 큰 영향을 줌을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.