ExpertPlex: A High-Goodput Disaggregated Serving System for MoE LLMs with Adaptive Persistent Kernels
- 발행일
- 출처
- arXiv
- 논문 번호
- 679
- 분야
- Distributed Systems
- arXiv 번호
- 2607.18002
MoE 모델 서빙에서 전문가(expert) 가중치는 두 단계가 공유하고 어텐션만 분리해, GPU 낭비 없이 처리량을 최대 2.01배 올린 서빙 시스템이다.
거대 MoE 언어모델은 가중치가 크고 계산량이 토큰마다 달라 서빙이 비효율적이다. 기존 방식은 프리필(입력 처리)과 디코드(토큰 생성)를 아예 다른 GPU 묶음에 복제해 두거나, 한 GPU를 둘로 쪼개 고정 할당하는데 둘 다 자원이 남거나 밀린다. ExpertPlex는 모델 무게의 95퍼센트가 넘는 전문가 부분을 두 단계가 함께 쓰고, 가벼운 어텐션만 단계별로 분리한다. 여기에 타일 단위로 끼어들 수 있는 상주 커널과 어텐션 쪽에서 먼저 시작하는 단방향 통신을 더해, 유효 처리량을 기존 분리 방식 대비 2.01배, 동거 방식 대비 1.66배 올렸다.
핵심 요약
- MoE 언어모델의 가중치 95퍼센트 이상이 전문가 부분이라, 프리필과 디코드가 각각 모델 전체를 복제하면 메모리가 크게 낭비된다.
- 핵심 발상은 무거운 전문가는 두 단계가 공유하고, 5퍼센트 미만인 어텐션만 단계별로 GPU를 따로 주는 혼합 구조다.
- 적응형 상주 커널(APK)이 행렬곱 타일 경계에서 스케줄링해, 커널을 다시 띄우거나 CPU가 끼어들지 않고도 급한 디코드 작업에 자리를 내주고 남는 자리는 프리필로 되돌린다.
- 어텐션 쪽에서 먼저 거는 단방향 MoE 통신으로 MoE 쪽 폴링을 없애 교착과 단계 간 네트워크 간섭을 피하고, 한 단계의 통신과 다른 단계의 계산을 겹친다.
- MiniMax-M2.7과 GLM-5.1-FP8 서빙 실험에서 유효 처리량이 청크 프리필 대비 5.65배, 인스턴스 단위 분리 대비 2.01배, Green Context 동거 대비 1.66배 올랐다.
- 선점 간격이 토큰 수가 아니라 타일 실행 시간에 달려 있어, 입력이 수천 토큰인 프리필도 짧은 디코드 작업이 끊고 들어갈 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.