金融 / 银行
China Merchants Bank:AI训练与推理的加速卡统一运营
- 企业
- China Merchants Bank
- 国家
- 中国
- 实施阶段
- 运营中
- 资料发布
- 日期依据
- 资料发布的时间,可能与启用日期不同。
- 依据核验方式
- 阅读原文正文
业务问题
招商银行在把AI推广到更多金融业务的过程中,需要在约一万张异构加速卡上同时运行大模型训练、微调和在线推理。仅靠增加卡片无法解决问题。训练任务必须等所需的工作节点和卡片全部就绪才能开始有效工作,因此需要稳定的容量;而在线推理必须随请求量快速扩缩。每当多个租户微调同一个基础模型时,还会为每个租户分别加载一份相同的基础模型,造成浪费。
使用的技术与数据
该行在Kubernetes之上建立统一的控制平面,同时把训练与推理的执行路径分开。训练请求先由Kueue根据队列和配额决定是否准入。随后由Kubernetes调度器和HAMi分配加速卡,Fluid则加快数据集与模型权重的读取。训练由自研的Twinkle在Ray上运行,在线推理由vLLM或SGLang提供服务。推理侧由Prometheus收集每秒请求数、队列深度和响应延迟,KEDA据此增减副本。为训练和推理设置不同的准入策略,由平台负责人决定。
成果
该行表示,已把99%的加速算力资源纳入该框架统一管理。平均加速卡算力利用率从35%提升到60%以上;在可比的模型与服务条件下,处理一百万个词元的推理成本下降超过60%。使用Twinkle后,五个采用LoRA方式微调的租户共享一个基础模型实例。基础模型副本从五个减少到一个,加速卡资源占用下降80%,可同时训练的租户数量提高到五倍。该行写道,生产环境默认使用五个租户,并已验证到八个。
局限与待解问题
原文未说明该平台从何时开始运行,也未说明各项数据的测量周期。这些数字来自该行平台团队在改造前后采用同一套内部测量方法所做的比较。
来源
本案例根据公开资料整理,并非 ATF Works 客户的成果。