유통 / 전자상거래 플랫폼
Shopify: 상품 정보의 통합과 표준화
- 기업
- Shopify
- 국가
- 캐나다
- 도입 상태
- 운영
- 자료 공개
- 날짜 기준
- 자료 발표 시점. 도입 시작일과 다를 수 있음
- 근거 확인 방법
- 원문 본문 열람
업무 문제
Shopify에는 수백만 판매자가 저마다 다른 방식으로 상품을 올린다. 상품 정보 대부분이 정해진 칸이 아니라 자유 서술 문장으로 들어오고, 판매자마다 속성 이름과 값을 스스로 정해 구조가 제각각이다. 오타와 빈 값, 잘못된 분류도 섞이고 어떤 정보는 글이 아니라 이미지에만 있다. 그 결과 의미 기반 검색과 필터가 잘 듣지 않고 같은 상품이 중복으로 흩어진다.
적용한 기술과 데이터
Shopify는 Global Catalogue라는 상품 정보 계층을 만들었다. 첫 층은 매일 1,000만 건이 넘는 상품 갱신을 스트리밍으로 받는다. 둘째 층은 vision large language model을 세부 조정해 분류, 속성 추출, 이미지 이해, 제목 표준화, 설명 요약, 후기 요약을 한 모델로 함께 처리한다. 셋째 층은 서로 다른 판매자가 같은 상품을 파는 경우를 묶고, 넷째 층은 묶인 상품의 속성과 설명, 이미지를 합쳐 대표 상품 기록을 만든다. 상용 API 대신 LlaVA 1.5 7B와 LLaMA 3.2 11B를 거쳐 지금은 Qwen2VL 7B를 세부 조정해 쓴다. 학습 자료는 여러 LLM 주석 에이전트가 만들고 시험 자료는 사람이 최종 라벨을 정한다.
성과
Shopify는 추론 기반이 하루 4,000만 건의 LLM 호출을 처리한다고 밝혔다. 필요한 항목만 뽑도록 학습과 프롬프트 방식을 바꿔 중앙값 지연을 2초에서 500밀리초로 줄였고 GPU 사용량을 40% 낮췄다고 설명했다. 회사는 이 자료가 판매자 관리 화면의 실시간 제안, 검색과 추천, Shopify Sidekick 같은 대화형 상거래에 쓰인다고 밝혔다.
한계와 남은 과제
하루 4,000만 건은 처리량이고 검색 성적이나 매출 개선율이 아니다. 원문은 분류와 속성 추출의 정확도 수치를 공개하지 않았다.
출처
공개된 자료를 정리한 사례입니다. ATF Works 도입 고객의 결과가 아닙니다.