金融 / 銀行
China Merchants Bank:AI学習と推論のアクセラレータ共同運用
- 企業
- China Merchants Bank
- 国
- 中国
- 導入状況
- 運用中
- 資料公開
- 日付の基準
- 資料が公開された時点。導入を開始した日とは異なる場合がある。
- 根拠の確認方法
- 原文の本文を閲覧
業務課題
China Merchants Bankは金融業務にAIを広げるなかで、大規模モデルの学習と微調整、オンライン推論を、種類の異なる約1万枚のアクセラレータカードの上でまとめて動かす必要があった。カードを増やすだけでは解決しない問題だった。学習ジョブは必要なワーカーとカードがすべて揃って初めて作業を始められるため安定した容量が必要で、オンライン推論はリクエスト量に応じて素早く増減させなければならない。複数の部門が同じ基盤モデルを微調整するたびに、その基盤モデルを部門の数だけ別々に読み込む無駄もあった。
使った技術とデータ
同行はKubernetes上に一つの管理基盤を置き、学習と推論の実行経路は分けた。学習リクエストは、まずKueueがキューと割当量を見て受け入れるかどうかを決める。その後Kubernetesのスケジューラとしくみ上のHAMiがカードを割り当て、Fluidが学習データとモデル重みの読み込みを速くする。学習はRay上で自社開発のTwinkleが担い、オンライン推論はvLLMまたはSGLangが処理する。推論側ではPrometheusが秒あたりのリクエスト数や待ち行列の長さ、応答遅延を集め、KEDAがその値でレプリカを増減させる。学習と推論に別々の受け入れ方針を置くことは、プラットフォームの担当者が決めた。
成果
同行は、アクセラレータ演算資源の99%をこの仕組みにまとめたと述べた。平均のアクセラレータ演算使用率は35%から60%以上に上がり、同等のモデルとサービス条件で100万トークンを処理する推論コストは60%以上下がったと説明した。Twinkleを使うと、LoRA方式で微調整する5つの部門が一つの基盤モデルを共有する。基盤モデルの複製は5つから1つに減り、アクセラレータ資源の使用は80%減り、同時に学習できる部門数は5倍になった。運用では5部門を既定値とし、8部門まで検証したと記している。
限界と残る課題
原文は、この仕組みをいつから運用しているのか、各数値の測定期間がどれくらいかを明らかにしていない。数値は、同行のプラットフォーム担当組織が改編の前後に同じ社内測定方法で比較した値である。
出典
公開資料をまとめた事例です。ATF Works導入企業の成果ではありません。