SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

발행일
출처
arXiv
논문 번호
694
분야
LLMs / NLP
arXiv 번호
2607.20145

화웨이 Ascend NPU 슈퍼POD에서 1.6조 매개변수 MoE 모델을 효율적으로 학습시키는 전체 스택 최적화 기법을 정리한 기술 보고서다.

이 논문은 한마디로 Ascend NPU 클러스터에서 트리llion급 MoE 모델을 효율적으로 학습시키는 방법을 보여준다. MFU 34.22%를 달성해 오픈소스 기준 대비 2.93배 향상했고, OR(운영연구) 과제 특화 CPT-SFT 파이프라인으로 GPT-5.4-Mini보다 3.98%p 높은 71.81% Pass@1을 기록했다. AuraKernel이라는 커널 최적화 에이전트와 NPU-CPU 협력 최적화가 핵심이다.

핵심 요약

  • Ascend SuperPOD에서 DeepSeek-V4-Pro(1.6T) 학습 MFU를 11.67%에서 34.22%로 끌어올렸다 (2.93배).
  • AuraKernel이라는 에이전트로 복잡한 NPU 커널을 자동 최적화했다.
  • OR(운영연구) 특화 CPT+SFT로 10K 고품질 데이터를 구축하고 solver 검증을 적용했다.
  • 특화 모델이 평균 zero-shot Pass@1 71.81%로 GPT-5.4-Mini보다 3.98%p, 베이스보다 11.27%p 높다.
  • GPU가 아닌 NPU 기반 트리llion 모델 학습의 전체 스택 실천 사례를 제공했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)