金融 / 数字资产交易所
Coinbase:在欺诈检测中引入用户行为顺序
- 企业
- Coinbase
- 国家
- 美国
- 实施阶段
- 运营中
- 资料发布
- 日期依据
- 资料发布的时间,可能与启用日期不同。
- 依据核验方式
- 阅读原文正文
业务问题
根据Coinbase技术博客的文章,Coinbase在从通知到欺诈检测的许多业务中使用机器学习,ML Platform管理的人工feature超过5,000个。同一篇文章解释说,这些feature是领域专家制作的长期汇总值,按天以batch或以准实时的streaming更新。同一篇文章称,像最近30天购买数字资产次数这样的feature,会丢失买了哪些资产、买了多少以及何时买的信息。同一篇文章解释说,再制作能包含这些信息的feature耗时很长,性能提升也不确定。
使用的技术与数据
根据同一篇文章,Coinbase在Tecton和Databricks Spark之上搭建了sequence feature框架,按时间顺序把登录、买入、卖出、加密资产转账等用户行为输入模型,以取代人工feature。同一篇文章列出的共同要求是每个sequence的事件类型少于100种、读取时最多取最近1,000个事件、在1至2秒内反映、在线读取的p99延迟低于100ms。根据同一篇文章,该框架的设计是机器学习工程师只需声明Kafka topic、事件格式和sequence条件,框架就会自动创建data source和Tecton feature view,并自带observability功能。同一篇文章解释说,数百个Kafka topic中有数千种格式各异的事件,因此把机器学习要用的事件逐一登记到ML Event Registry,实时处理从Kafka读取,batch和backfill从Delta Lake读取,并统一为user_id、event_name、timestamp、metadata的共同格式。根据同一篇文章,处理间隔为0秒的continuous mode在收到事件后立即写入DynamoDB,一个用户的事件在读取时汇总成完整的sequence。放入哪些事件和时间范围由工程师决定,同一篇文章解释说,Transformer、LSTM等深度学习模型可以直接从这些sequence中学习。
成果
根据同一篇文章,负载最大的实时作业之一每秒接收约2,000个事件,平均end-to-end延迟低于500ms。同一篇文章称,改用在一台machine上同时运行Spark driver和worker的Databricks Single Node cluster后,所有实时作业的反映速度保持不变或有所提升,CPU和计算成本减少了20%至40%。同一篇文章称,初步结果提升了欺诈检测和推荐模型的性能,并在过去1年里为关键业务指标带来了数千万美元规模的效果。根据同一篇文章,在许多关键模型中,有几个sequence feature进入全局feature重要性前10名。
局限与待解问题
文章没有按模型或指标拆分数千万美元的效果,也没有单独说明欺诈检测减少的损失规模。搜索工具的摘录显示了之后转向Databricks实时处理方式的客户案例,但本次调查没有打开该原文。
来源
- How Coinbase Builds Sequence Features for Machine Learningcoinbase.com, 查阅
本案例根据公开资料整理,并非 ATF Works 客户的成果。