零售 / 电子商务平台

Shopify:商品信息的整合与标准化

企业
Shopify
国家
加拿大
实施阶段
运营中
资料发布
日期依据
资料发布的时间,可能与启用日期不同。
依据核验方式
阅读原文正文

业务问题

Shopify上有数百万商家各按自己的方式上架商品。大部分商品信息不是填进固定字段,而是以自由描述的句子录入,属性名称和取值由各商家自行决定,结构五花八门。其中还混有错别字、空值和错误分类,有些信息只存在于图片而不在文字中。结果是语义检索和筛选效果不佳,同一件商品重复散落在各处。

使用的技术与数据

Shopify建立了名为Global Catalogue的商品信息层。第一层以流式方式接收每天超过1,000万条的商品更新。第二层对vision large language model做精细调优,用一个模型同时处理分类、属性抽取、图像理解、标题标准化、描述摘要和评论摘要。第三层把不同商家销售同一件商品的情况归并,第四层把归并后商品的属性、描述和图片合并成代表性的商品记录。公司没有使用商用API,而是先后经过LlaVA 1.5 7B和LLaMA 3.2 11B,如今精调使用Qwen2VL 7B。训练素材由多个LLM标注代理生成,测试素材的最终标签由人来确定。

成果

Shopify表示,其推理底座每天处理4,000万次LLM调用。公司说明,通过调整训练和prompt方式、只抽取必要字段,把延迟中位数从2秒降到500毫秒,GPU用量降低了40%。公司称,这些数据用于商家后台界面的实时建议、搜索与推荐,以及Shopify Sidekick这类对话式商务。

局限与待解问题

每天4,000万次是处理量,不是检索表现或销售改善率。原文未公开分类和属性抽取的准确率数字。

来源

本案例根据公开资料整理,并非 ATF Works 客户的成果。

阅读原文 (在新标签页中打开)