금융 / 은행

China Merchants Bank: AI 학습과 추론의 가속기 공동 운영

기업
China Merchants Bank
국가
중국
도입 상태
운영
자료 공개
날짜 기준
자료 발표 시점. 도입 시작일과 다를 수 있음
근거 확인 방법
원문 본문 열람

업무 문제

China Merchants Bank은 금융 업무에 AI를 넓히면서 대형 모델 학습과 미세조정, 온라인 추론을 종류가 서로 다른 가속기 카드 약 1만 장 위에서 함께 돌려야 했다. 카드를 더 늘리는 것으로는 풀리지 않는 문제였다. 학습 작업은 필요한 작업자와 카드가 모두 준비되어야 일을 시작하기 때문에 안정된 용량이 필요하고, 온라인 추론은 요청량에 따라 빠르게 늘리고 줄여야 한다. 여러 부서가 같은 기본 모델을 미세조정할 때마다 기본 모델을 부서 수만큼 따로 올리는 낭비도 있었다.

적용한 기술과 데이터

이 은행은 Kubernetes 위에 하나의 관리 체계를 두고 학습과 추론의 실행 경로는 나누었다. 학습 요청은 Kueue가 대기열과 할당량을 보고 받아들일지 먼저 정한다. 그다음 Kubernetes 일정 관리와 HAMi가 카드를 나누어 주고 Fluid가 학습 데이터와 모델 가중치 읽기를 빠르게 한다. 학습은 Ray 위에서 자체 개발한 Twinkle이 맡고 온라인 추론은 vLLM이나 SGLang이 처리한다. 추론 쪽에서는 Prometheus가 초당 요청 수와 대기 길이, 응답 지연을 모으고 KEDA가 그 값으로 복제본을 늘리거나 줄인다. 학습과 추론에 서로 다른 수용 정책을 둘지는 플랫폼 담당자가 정했다.

성과

이 은행은 가속기 연산 자원의 99%를 이 체계로 묶었다고 밝혔다. 평균 가속기 연산 사용률은 35%에서 60% 이상으로 올랐고, 같은 모델과 서비스 조건에서 토큰 100만 개를 처리하는 추론 비용은 60% 넘게 줄었다고 설명했다. Twinkle을 쓰면 LoRA 방식으로 미세조정하는 부서 다섯 곳이 기본 모델 하나를 함께 쓴다. 기본 모델 사본이 다섯 개에서 한 개로 줄어 가속기 자원 사용이 80% 감소했고 동시에 학습할 수 있는 부서 수는 다섯 배가 되었다. 운영에서는 부서 다섯 곳을 기본값으로 쓰고 여덟 곳까지 검증했다고 적었다.

한계와 남은 과제

원문은 이 체계를 언제부터 운영했는지와 각 수치의 측정 기간을 밝히지 않았다. 수치는 이 은행 플랫폼 담당 조직이 개편 전후에 같은 내부 측정 방법으로 비교한 값이다.

출처

공개된 자료를 정리한 사례입니다. ATF Works 도입 고객의 결과가 아닙니다.

원문 보기 (새 탭에서 열림)