ゲーム / オンラインゲームプラットフォーム

Roblox:文字、音声、画像の有害コンテンツの判別

企業
Roblox
国
米国
導入状況
運用中
資料公開
日付の基準
資料が公開された時点。導入を開始した日とは異なる場合がある。
根拠の確認方法
原文の本文を閲覧

業務課題

Robloxでは一日にチャット61億件と音声110万時間がやり取りされる。言語は28である。人だけでこの量をミリ秒のうちに確認するのは不可能だ。同社は、チャットだけを任せても数十万人が24時間張り付く必要があると記した。

使った技術とデータ

土台には、複数の形式を一緒に扱う大型transformerモデルがある。運用の条件に合わせてこのモデルを蒸留し量子化して速く動かす。個人情報のフィルタは要求量が増え、従来のCPUサーバーでは支えきれなくなった。そこでGPUを基にした配信の構造を新しく作り、トークン処理と推論を分けて処理量を四倍に増やした。音声の分類器は八つの言語で15秒のうちに判定し、同社はこのモデルを公開した。人はまれな事例、複雑な調査、異議の申し立てを担う。異議の申し立てで判定が覆った事例は、再び学習の資料に入る。

成果

新しい構造に替えたあと、個人情報のフィルタは最大で毎秒370,000件を処理する。同社は、誤検知が30%減り、そのおかげで自動で捉える個人情報の言及が25%増えたと述べた。文字のフィルタ全体では毎秒750,000件を超えて処理する。2024年2月から12月までに上がったコンテンツは約1兆件で、方針違反として検出されたのは0.01%の水準だと説明した。

限界と残る課題

誤検知の減少と検出の増加は、個人情報のフィルタに限った値である。プラットフォーム全体の安全性が同じ比率で良くなったという意味ではない。

出典

公開資料をまとめた事例です。ATF Works導入企業の成果ではありません。

原文を読む (新しいタブで開きます)