游戏 / 在线游戏平台
Roblox:儿童风险苗头的早期筛查与审核优先级排序
- 企业
- Roblox
- 国家
- 美国
- 实施阶段
- 运营中
- 资料发布
- 日期依据
- 资料发布的时间,可能与启用日期不同。
- 依据核验方式
- 阅读原文正文
业务问题
Roblox上有多人共用的聊天,其中会出现试图把儿童置于风险之中的行为。难点在于,这类对话一开始并不露骨。只有等到措辞变得明确,其他检测机制才会发现,而那时情况可能已经发展下去了。公司写到,安全是一项没有任何一家公司能够独自解决的共同责任。
使用的技术与数据
Roblox Sentinel是一个为捕捉儿童风险早期信号而构建的模型。它基于contrastive learning构建,并同时学习了未出问题的对话与后来变得有害的对话这两类模式。系统把新进入的对话与这些模式相比对,在事态升级之前把细微的预警信号标记出来供人工审核。Sentinel本身不对账号作出处置,而是让人工审核者优先查看最需要关注的聊天。审核者随后对确认有问题的账号采取措施,必要时向有关机构举报。第2版把分数组合方式从两种增加到六种,每一种对应不同性质的数据。由于不再需要为每一组设定重新计算评估数据,一次扫描324种配置可在三分钟内完成,而同样的工作过去需要将近一小时。
成果
公司表示,在截至2026年8月7日的12个月里,其检测到的案件中有接近70%来自Sentinel的早期检测,并且往往比其他方法更早发现。在改进配置搜索之后,衡量排序质量的ROC-AUC从默认设定的0.894提升到所找到的最佳配置的0.996。公司表示,这些模型的版本已经在Roblox上运行,用于检测索取或分享个人信息的行为、标记儿童风险的早期迹象,并实时审核语音聊天。在同一份资料中,公司宣布把包括Sentinel在内的三个安全模型以及一套评估数据集发布到ROOST Model Community。
局限与待解问题
70%指的是已检测案件中由Sentinel率先发现的比例。原文没有说明在全部儿童风险案件中漏掉了多少。ROC-AUC的0.894与0.996是用于挑选模型配置的评估数值,并非实际运营成效。原文同样没有给出误报数量、人工审核团队规模,以及Sentinel首次启用的时间。
来源
- Roblox Brings Open-Source Safety Models to ROOST Model Communityabout.roblox.com, 查阅
本案例根据公开资料整理,并非 ATF Works 客户的成果。