SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
- 발행일
- 출처
- arXiv
- 논문 번호
- 694
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.20145
화웨이 Ascend NPU 슈퍼POD에서 1.6조 매개변수 MoE 모델을 효율적으로 학습시키는 전체 스택 최적화 기법을 정리한 기술 보고서다.
이 논문은 한마디로 Ascend NPU 클러스터에서 트리llion급 MoE 모델을 효율적으로 학습시키는 방법을 보여준다. MFU 34.22%를 달성해 오픈소스 기준 대비 2.93배 향상했고, OR(운영연구) 과제 특화 CPT-SFT 파이프라인으로 GPT-5.4-Mini보다 3.98%p 높은 71.81% Pass@1을 기록했다. AuraKernel이라는 커널 최적화 에이전트와 NPU-CPU 협력 최적화가 핵심이다.
핵심 요약
- Ascend SuperPOD에서 DeepSeek-V4-Pro(1.6T) 학습 MFU를 11.67%에서 34.22%로 끌어올렸다 (2.93배).
- AuraKernel이라는 에이전트로 복잡한 NPU 커널을 자동 최적화했다.
- OR(운영연구) 특화 CPT+SFT로 10K 고품질 데이터를 구축하고 solver 검증을 적용했다.
- 특화 모델이 평균 zero-shot Pass@1 71.81%로 GPT-5.4-Mini보다 3.98%p, 베이스보다 11.27%p 높다.
- GPU가 아닌 NPU 기반 트리llion 모델 학습의 전체 스택 실천 사례를 제공했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.