情報技術 / 翻訳ソフトウェア
DeepL:翻訳モデルの学習と実行の効率改善
- 企業
- DeepL
- 国
- ドイツ
- 導入状況
- 運用中
- 資料公開
- 日付の基準
- 資料が公開された時点。導入を開始した日とは異なる場合がある。
- 根拠の確認方法
- 原文の本文を閲覧
業務課題
DeepLは、NVIDIA H100 GPUを544枚使ったDGX SuperPODを導入して演算能力を大きく増やしたものの、16ビットのBF16形式で計算している間は、同じ遅延時間の中で大きくできるモデルの規模と一度に受けられる要求の数が結び付いたままだったと述べた。同社は、現代の言語モデルの演算の大半が行列の掛け算であるため精度を8ビットに落とせば処理量を増やせる一方、FP8は表現できる範囲と精度がBF16の半分しかなく、学習品質が下がる恐れがあると説明した。
使った技術とデータ
同社はNVIDIA Transformer Engineを使い、既存の学習コードをBF16からFP8へ移した。NVIDIAの推奨どおり既定の設定を用い、次のトークンの確率分布を予測する順伝播には精度の高いE4M3を、勾配を計算する逆伝播には範囲の広いE5M2を使う。FP8の重みテンソルの横に32ビットのスケーリング値を一緒に保存して値が範囲を超えたり足りなくなったりするのを防ぎ、テンソルを掛けるときにその値も合わせて計算する。事前学習の後は課題ごとの微調整、大きなモデルを小さなモデルへ移す蒸留、強化学習を行い、複数の並列化方式で多数のGPUを使う。推論の段階ではNVIDIA TensorRT LLMが学習済みの重みからエンジンを作り、カーネル融合や最適化したCUDAコード、KVキャッシュ、要求をつなげて処理するバッチ処理を適用する。品質の確認は、パラメータ15億個のモデルを3兆トークンで両方の形式それぞれで学習し、学習損失と英語およびドイツ語の検証perplexityを比べる方法で行った。
成果
DeepLは、学習が使う演算資源の活用度を表すMFUが44.6%からFP8で67%まで上がり、学習が50%速くなったと述べた。別の学習構成では、NVIDIAと一緒にTransformer Engineの使い方を詰め、15か月かけてさらに25%引き上げ、80%のMFUに達したと説明した。品質については、学習損失はBF16の方がごくわずかに低かったものの、その差は段階ごとの揺れに埋もれる程度であり、英語とドイツ語の検証perplexityでは低下がなかったと述べた。推論では、ほとんどのバッチ規模でBF16と同じ遅延時間のまま2倍の処理量を出したと説明した。同社は、その結果としてパラメータがはるかに多いモデルを作ることができ、従来のモデルより欧州の言語で1.4倍、英語と日本語のような難しい組み合わせで1.7倍良い翻訳を出しながら、運用推論の同じ遅延時間の中に収まると述べた。品質の判断は言語の専門家が行ったと説明した。
限界と残る課題
従来のモデルより1.4倍、1.7倍良いという値を、どのような評価方法で何件を比べて得たのかは原文にない。FP8を運用推論に初めて適用した時期も原文にない。翻訳品質を判断した言語専門家の人数や評価の基準も原文にない。
出典
公開資料をまとめた事例です。ATF Works導入企業の成果ではありません。