配達とモビリティ / 配車と配達

Grab:東南アジアの文書の文字と項目の抽出

企業
Grab
国
シンガポール
導入状況
実証
資料公開
日付の基準
資料が公開された時点。導入を開始した日とは異なる場合がある。
根拠の確認方法
原文の本文を閲覧

業務課題

Grabは、身分証、運転免許証、登録証といった書類から情報を取り出さなければならない。顧客確認の手続きの最初の段階である。東南アジアは言語と書式が多様で、この作業がとりわけ難しい。従来のOCRは書式が変わると揺れ、商用のLLMは東南アジアの言語の理解が弱く、誤りと作り話があり、応答も遅かった。

使った技術とデータ

GrabはQwen2-VL 2Bを土台のモデルに選んだ。全体の微調整ができる大きさで、タイ語とベトナム語の処理に有利で、元の解像度をそのまま読むからである。学習の資料は二つの流れからなる。Common Crawlから東南アジアの言語の文を取り出し、書体と背景を変えた合成の画像を作った。インドネシア語、タイ語、ベトナム語、英語を入れた。実際の書類は社内の自動ラベル付けの道具Documintでラベルを取り出し、人が改めて検収した。LoRAの方式はラテン文字の外で足りず、全体の媒介変数を直す二段階の学習に変えた。続いて、Qwen2-VL 2Bのvision encoderとQwen2.5 0.5Bの言語デコーダーをつないで、約1Bの大きさのモデルを新しく作った。

成果

Grabは、全体を微調整した2Bのモデルが基準に比べてタイ語の書類の精度を70%ポイント、ベトナム語を40%ポイント上げたと述べた。新しく作った約1Bのモデルは、ほとんどの書類の種類で2Bのモデルとの精度の差が3%ポイント以内だった。遅延時間は2Bのモデルや従来のOCR、外部のAPIより良かったと説明した。外部のAPIはP99の遅延がP50の3倍から4倍まで開き、大規模な適用に合わなかったと記した。

限界と残る課題

原文はモデルの開発と評価を扱っている。実際の運用へ移した時点や、承認の自動化の範囲を示した文はない。

出典

公開資料をまとめた事例です。ATF Works導入企業の成果ではありません。

原文を読む (新しいタブで開きます)