游戏 / 在线游戏平台

Roblox:识别文本、语音和图像中的有害内容

企业
Roblox
国家
美国
实施阶段
运营中
资料发布
日期依据
资料发布的时间,可能与启用日期不同。
依据核验方式
阅读原文正文

业务问题

在Roblox上,一天有61亿条聊天和110万小时语音往来,涉及28种语言。仅靠人力在毫秒内审核这一体量是不可能的。公司写到,单是聊天一项就需要数十万人全天候盯着。

使用的技术与数据

底层是一个能同时处理多种形式的大型transformer模型。为适配运行条件,公司对该模型做了蒸馏和量化以提高速度。随着请求量上升,个人信息过滤器已超出原有CPU服务器的承载能力。于是公司新建了基于GPU的服务架构,把分词处理与推理拆开,把吞吐量提高到四倍。语音分类器可在八种语言中于15秒内作出判定,公司已公开该模型。人负责罕见案例、复杂调查和申诉。申诉中被推翻的判定会重新作为训练素材。

成果

切换到新架构后,个人信息过滤器最高可处理每秒370,000次请求。公司表示,误报减少了30%,因此自动捕捉到的个人信息提及增加了25%。文本过滤整体每秒处理超过750,000次请求。公司说明,2024年2月至12月上传的内容约1万亿条,其中被检测为违反政策的约占0.01%。

局限与待解问题

误报下降和检出增加是仅限于个人信息过滤器的数字,并不意味着平台整体安全性以同样比例改善。

来源

本案例根据公开资料整理,并非 ATF Works 客户的成果。

阅读原文 (在新标签页中打开)