游戏 / 在线游戏平台
Roblox:识别文本、语音和图像中的有害内容
- 企业
- Roblox
- 国家
- 美国
- 实施阶段
- 运营中
- 资料发布
- 日期依据
- 资料发布的时间,可能与启用日期不同。
- 依据核验方式
- 阅读原文正文
业务问题
在Roblox上,一天有61亿条聊天和110万小时语音往来,涉及28种语言。仅靠人力在毫秒内审核这一体量是不可能的。公司写到,单是聊天一项就需要数十万人全天候盯着。
使用的技术与数据
底层是一个能同时处理多种形式的大型transformer模型。为适配运行条件,公司对该模型做了蒸馏和量化以提高速度。随着请求量上升,个人信息过滤器已超出原有CPU服务器的承载能力。于是公司新建了基于GPU的服务架构,把分词处理与推理拆开,把吞吐量提高到四倍。语音分类器可在八种语言中于15秒内作出判定,公司已公开该模型。人负责罕见案例、复杂调查和申诉。申诉中被推翻的判定会重新作为训练素材。
成果
切换到新架构后,个人信息过滤器最高可处理每秒370,000次请求。公司表示,误报减少了30%,因此自动捕捉到的个人信息提及增加了25%。文本过滤整体每秒处理超过750,000次请求。公司说明,2024年2月至12月上传的内容约1万亿条,其中被检测为违反政策的约占0.01%。
局限与待解问题
误报下降和检出增加是仅限于个人信息过滤器的数字,并不意味着平台整体安全性以同样比例改善。
来源
- How Roblox Uses AI to Moderate Content on a Massive Scale | Robloxcorp.roblox.com, 查阅
本案例根据公开资料整理,并非 ATF Works 客户的成果。