信息技术 / 翻译软件

DeepL:提升翻译模型训练与运行的效率

企业
DeepL
国家
德国
实施阶段
运营中
资料发布
日期依据
资料发布的时间,可能与启用日期不同。
依据核验方式
阅读原文正文

业务问题

DeepL表示,引入由544块NVIDIA H100 GPU组成的DGX SuperPOD后算力大幅提升,但只要计算仍以16位的BF16格式进行,在同一延迟范围内能够扩大的模型规模与能够同时承接的请求数量就始终捆绑在一起。该公司说明,现代语言模型的运算大多是矩阵乘法,把精度降到8位可以提高吞吐量,但FP8能表示的范围与精度只有BF16的一半,存在拉低训练质量的风险。

使用的技术与数据

该公司使用NVIDIA Transformer Engine,把既有训练代码从BF16迁移到FP8。按照NVIDIA的建议采用默认配置,在预测下一个词元概率分布的前向传播中使用精度更高的E4M3,在计算梯度的反向传播中使用范围更宽的E5M2。团队在FP8权重张量旁一并保存32位的缩放值,以防数值溢出或下溢,并在张量相乘时把该值一同纳入计算。预训练之后再做针对具体任务的微调、把大模型迁移为小模型的蒸馏以及强化学习,并采用多种并行化方式来使用大量GPU。在推理阶段,NVIDIA TensorRT LLM会用训练好的权重构建引擎,并应用内核融合、优化过的CUDA代码、KV缓存以及把请求接续处理的批处理。质量验证的做法是:用三万亿词元分别在两种格式下训练一个15亿参数的模型,比较训练损失以及英语与德语的验证perplexity。

成果

DeepL表示,衡量训练实际用到多少可用算力的MFU,从44.6%在FP8下提升到67%,使训练速度加快了50%。在另一套训练配置中,公司与NVIDIA一起打磨对Transformer Engine的使用,在15个月里又提升了25%,达到80%的MFU。在质量方面,公司表示BF16的训练损失仅略低一点,但这一差距被两种格式逐步之间的波动所淹没,而在英语与德语的验证perplexity上没有出现退化。在推理方面,公司表示在大多数批量规模下,FP8能以与BF16相同的延迟提供两倍的吞吐量。该公司表示,由此可以构建参数多得多的模型,其翻译在欧洲语言上比以往模型好1.4倍,在英语与日语这类更难的语言组合上好1.7倍,同时仍能落在生产推理相同的延迟范围之内。公司说明,质量由语言专家评判。

局限与待解问题

原文没有说明1.4倍与1.7倍这两个相对以往模型的数值,是用何种评估方法、比较了多少条译文得出的。原文也没有说明FP8首次应用于生产推理的时间,以及评判翻译质量的语言专家人数与评判标准。

来源

本案例根据公开资料整理,并非 ATF Works 客户的成果。

阅读原文 (在新标签页中打开)