配送与出行 / 网约车与配送

Grab:提取东南亚文件的文字与字段

企业
Grab
国家
新加坡
实施阶段
试点验证
资料发布
日期依据
资料发布的时间,可能与启用日期不同。
依据核验方式
阅读原文正文

业务问题

Grab需要从身份证、驾照、登记证之类的文件中提取信息,这是客户身份核验的第一步。东南亚语言和版式多样,使这项工作格外困难。原有OCR在版式变化时表现不稳,商用LLM对东南亚语言的理解较弱,存在错误和凭空编造,响应也慢。

使用的技术与数据

Grab选择Qwen2-VL 2B作为基础模型。原因是它的规模允许做全参数微调,对泰语和越南语处理有优势,并且能按原始分辨率读取图像。训练素材来自两条线。一是从Common Crawl中抽取东南亚语言句子,生成改变字体和背景的合成图像,涵盖印尼语、泰语、越南语和英语。二是真实文件用内部自动标注工具Documint产出标签,再由人复核。LoRA方式在拉丁字母之外表现不足,于是改为更新全部参数的两阶段训练。随后,团队把Qwen2-VL 2B的vision encoder与Qwen2.5 0.5B的语言解码器拼接,构建了约1B规模的新模型。

成果

Grab表示,全参数微调的2B模型相对基线把泰语文件的准确率提高了70个百分点,越南语提高了40个百分点。新建的约1B模型在大多数文件类型上与2B模型的准确率差距在3个百分点以内。公司说明,其延迟优于2B模型、原有OCR和外部API。文中写到,外部API的P99延迟会拉长到P50的三到四倍,不适合大规模应用。

局限与待解问题

原文讲的是模型开发与评估,没有说明何时转入实际运行,也没有说明审批自动化的范围。

来源

本案例根据公开资料整理,并非 ATF Works 客户的成果。

阅读原文 (在新标签页中打开)