배달과 이동 / 차량 호출과 배달
Grab: 동남아 문서의 글자와 항목 추출
- 기업
- Grab
- 국가
- 싱가포르
- 도입 상태
- 실증
- 자료 공개
- 날짜 기준
- 자료 발표 시점. 도입 시작일과 다를 수 있음
- 근거 확인 방법
- 원문 본문 열람
업무 문제
Grab은 신분증, 운전면허증, 등록증 같은 서류에서 정보를 뽑아야 한다. 고객 확인 절차의 첫 단계다. 동남아시아는 언어와 서식이 다양해 이 작업이 특히 어렵다. 기존 OCR은 서식이 달라지면 흔들렸고 상용 LLM은 동남아 언어 이해가 약하고 오류와 지어내기가 있었으며 응답도 느렸다.
적용한 기술과 데이터
Grab은 Qwen2-VL 2B를 바탕 모델로 골랐다. 전체 미세조정이 가능한 크기이고 태국어와 베트남어 처리에 유리하며 원본 해상도를 그대로 읽기 때문이다. 학습 자료는 두 갈래다. Common Crawl에서 동남아 언어 문장을 뽑아 글꼴과 배경을 바꾼 합성 이미지를 만들었다. 인도네시아어, 태국어, 베트남어, 영어를 담았다. 실제 서류는 사내 자동 라벨링 도구 Documint로 라벨을 뽑고 사람이 다시 검수했다. LoRA 방식은 라틴 문자 밖에서 부족해 전체 매개변수를 고치는 두 단계 학습으로 바꿨다. 이어서 Qwen2-VL 2B의 vision encoder와 Qwen2.5 0.5B의 언어 디코더를 붙여 약 1B 크기 모델을 새로 만들었다.
성과
Grab은 전체 미세조정한 2B 모델이 기준 대비 태국어 서류 정확도를 70%포인트, 베트남어를 40%포인트 올렸다고 밝혔다. 새로 만든 약 1B 모델은 대부분의 서류 유형에서 2B 모델과 정확도 차이가 3%포인트 안쪽이었다. 지연 시간은 2B 모델과 기존 OCR, 외부 API보다 나았다고 설명했다. 외부 API는 P99 지연이 P50의 3배에서 4배까지 벌어져 대규모 적용에 맞지 않았다고 적었다.
한계와 남은 과제
원문은 모델 개발과 평가를 다룬다. 실제 운영 전환 시점이나 승인 자동화 범위를 밝힌 문장은 없다.
출처
- How we built a custom vision LLM to improve document processing at Grabengineering.grab.com, 확인
공개된 자료를 정리한 사례입니다. ATF Works 도입 고객의 결과가 아닙니다.