금융 / 가상자산 거래소

Coinbase: 사기 탐지에 사용자 행동 순서 반영

기업
Coinbase
국가
미국
도입 상태
운영
자료 공개
날짜 기준
자료 발표 시점. 도입 시작일과 다를 수 있음
근거 확인 방법
원문 본문 열람

업무 문제

Coinbase 기술 블로그 글에 따르면 Coinbase는 알림부터 사기 탐지까지 여러 업무에 머신러닝을 쓰고, ML Platform이 관리하는 수작업 feature가 5,000개를 넘는다. 같은 글은 이런 feature가 영역 전문가가 만든 장기 집계값이며 하루 단위 batch나 준실시간 streaming으로 갱신된다고 설명했다. 같은 글은 최근 30일 동안 디지털 자산을 산 횟수 같은 feature에는 어떤 자산을 얼마나, 언제 샀는지가 빠진다고 밝혔다. 같은 글은 그 정보를 담는 feature를 더 만드는 일이 오래 걸리고 성능 향상도 불확실하다고 설명했다.

적용한 기술과 데이터

같은 글에 따르면 Coinbase는 수작업 feature 대신 로그인, 매수, 매도, 가상자산 송금 같은 사용자 행동을 시간 순서대로 모델에 넣는 sequence feature 체계를 Tecton과 Databricks Spark 위에 만들었다. 같은 글은 공통 요건으로 sequence당 이벤트 종류 100개 미만, 조회 때 최근 이벤트 최대 1,000개, 1초에서 2초 안의 반영, 온라인 조회 p99 지연 100ms 미만을 들었다. 같은 글에 따르면 이 체계는 머신러닝 엔지니어가 Kafka topic, 이벤트 형식, sequence 조건만 선언하면 data source와 Tecton feature view를 자동으로 만들고 observability 기능도 기본으로 갖추도록 설계됐다. 같은 글은 수백 개 Kafka topic에 형식이 제각각인 이벤트가 수천 종 있어 머신러닝에 쓸 이벤트를 ML Event Registry에 하나씩 등록하고, 실시간 처리는 Kafka에서, batch와 backfill은 Delta Lake에서 읽어 user_id, event_name, timestamp, metadata의 공통 형식으로 바꾼다고 설명했다. 같은 글에 따르면 처리 간격 0초의 continuous mode가 이벤트를 받는 즉시 DynamoDB에 쓰고, 한 사용자의 이벤트는 조회할 때 sequence 전체로 묶인다. 어떤 이벤트와 기간을 넣을지는 엔지니어가 정하고, 같은 글은 Transformer나 LSTM 같은 딥러닝 모델이 이런 sequence에서 직접 학습할 수 있다고 설명했다.

성과

같은 글에 따르면 가장 부하가 큰 실시간 작업 가운데 하나는 초당 약 2,000건의 이벤트를 받으면서 평균 end-to-end 지연 500ms 미만을 냈다. 같은 글은 Spark의 driver와 worker를 한 machine에서 함께 실행하는 Databricks Single Node cluster로 바꾼 뒤 모든 실시간 작업의 반영 속도를 같거나 더 낫게 유지하면서 CPU와 계산 비용을 20%에서 40% 줄였다고 밝혔다. 같은 글은 초기 결과로 사기 탐지와 추천 모델의 성능이 좋아졌고 지난 1년 동안 핵심 사업 지표에서 수천만 달러 규모의 효과를 냈다고 밝혔다. 같은 글에 따르면 여러 핵심 모델에서 sequence feature 몇 개가 전체 feature 중요도 상위 10위 안에 든다.

한계와 남은 과제

같은 글은 수천만 달러 효과를 모델별, 지표별로 나누어 밝히지 않았고 사기 탐지에서 줄어든 손실 규모도 따로 적지 않았다. 검색 도구 발췌에는 이후 Databricks 실시간 처리 방식으로 옮겼다는 고객 사례가 보였으나 이번 조사에서 그 원문은 열람하지 않았다.

출처

공개된 자료를 정리한 사례입니다. ATF Works 도입 고객의 결과가 아닙니다.

원문 보기 (새 탭에서 열림)