零售 / 电子商务
Amazon:商品属性标准化与纠错
- 企业
- Amazon
- 国家
- 美国
- 实施阶段
- 运营中
- 资料发布
- 日期依据
- 资料发布的时间,可能与启用日期不同。
- 依据核验方式
- 通过搜索工具的正文摘录核验
业务问题
Amazon的商品目录有数亿件商品,每天有数百万条商品信息新增或修改。公司过去靠按商品类目分别构建的machine learning模型来保证质量。这种方式很适合像盘子这样用尺寸、形状、颜色、材质来描述的商品。属性复杂或细微的商品则需要单独训练的模型或人工复核。
使用的技术与数据
Amazon在此基础上接入了大语言模型。首先把整个目录按商品类型和属性取值归类,统计每个取值出现的频率和位置。在无线耳机的Bluetooth、BT、BT 5.1等写法中,挑出统计上最优的候选告诉模型。统计无法解决的细微差别则通过prompt tuning处理:在prompt中加入要与候选列表的粒度保持一致的指令,避免把stainless steel与440 stainless steel这类更具体的取值抹掉。这样调优后的模型在整个目录上完成三项工作:识别标准属性取值、收集同义的不同写法、检测错误或无意义的录入。
成果
Amazon表示,在新方式下,卖家提交的最新取值几天内就能体现在目录中。公司说明,人工复核也因此节省了数千小时,可监控和更新的语言数量也增加了。公司称,质量管控已经延伸到旧方式下因成本过高而无法触及的目录角落。
局限与待解问题
节省数千小时的基准时间段和计算方式并未公开。这篇文章中也没有购买或销售变化的数字。
来源
- Using LLMs to improve Amazon product listings - Amazon Scienceamazon.science, 查阅
本案例根据公开资料整理,并非 ATF Works 客户的成果。