ゲーム / オンラインゲームプラットフォーム
Roblox:文字、音声、画像の有害コンテンツの判別
- 企業
- Roblox
- 国
- 米国
- 導入状況
- 運用中
- 資料公開
- 日付の基準
- 資料が公開された時点。導入を開始した日とは異なる場合がある。
- 根拠の確認方法
- 原文の本文を閲覧
業務課題
Robloxでは一日にチャット61億件と音声110万時間がやり取りされる。言語は28である。人だけでこの量をミリ秒のうちに確認するのは不可能だ。同社は、チャットだけを任せても数十万人が24時間張り付く必要があると記した。
使った技術とデータ
土台には、複数の形式を一緒に扱う大型transformerモデルがある。運用の条件に合わせてこのモデルを蒸留し量子化して速く動かす。個人情報のフィルタは要求量が増え、従来のCPUサーバーでは支えきれなくなった。そこでGPUを基にした配信の構造を新しく作り、トークン処理と推論を分けて処理量を四倍に増やした。音声の分類器は八つの言語で15秒のうちに判定し、同社はこのモデルを公開した。人はまれな事例、複雑な調査、異議の申し立てを担う。異議の申し立てで判定が覆った事例は、再び学習の資料に入る。
成果
新しい構造に替えたあと、個人情報のフィルタは最大で毎秒370,000件を処理する。同社は、誤検知が30%減り、そのおかげで自動で捉える個人情報の言及が25%増えたと述べた。文字のフィルタ全体では毎秒750,000件を超えて処理する。2024年2月から12月までに上がったコンテンツは約1兆件で、方針違反として検出されたのは0.01%の水準だと説明した。
限界と残る課題
誤検知の減少と検出の増加は、個人情報のフィルタに限った値である。プラットフォーム全体の安全性が同じ比率で良くなったという意味ではない。
出典
- How Roblox Uses AI to Moderate Content on a Massive Scale | Robloxcorp.roblox.com, 確認
公開資料をまとめた事例です。ATF Works導入企業の成果ではありません。