정보기술 / 번역 소프트웨어

DeepL: 번역 모델의 학습과 실행 효율 개선

기업
DeepL
국가
독일
도입 상태
운영
자료 공개
날짜 기준
자료 발표 시점. 도입 시작일과 다를 수 있음
근거 확인 방법
원문 본문 열람

업무 문제

DeepL은 NVIDIA H100 GPU 544장으로 구성한 DGX SuperPOD를 들이면서 연산 능력을 크게 늘렸지만, 16비트 BF16 형식으로 계산하는 동안에는 같은 지연 시간 안에서 키울 수 있는 모델 크기와 한 번에 받을 수 있는 요청 수가 함께 묶여 있었다고 밝혔다. 이 회사는 현대 언어 모델 연산의 대부분이 행렬 곱셈이라 정밀도를 8비트로 낮추면 처리량을 늘릴 수 있지만, FP8은 표현 범위와 정밀도가 BF16의 절반이라 학습 품질이 떨어질 위험이 있다고 설명했다.

적용한 기술과 데이터

이 회사는 NVIDIA Transformer Engine으로 기존 학습 코드를 BF16에서 FP8로 옮겼다. NVIDIA 권고대로 기본 설정을 써서 다음 토큰의 확률 분포를 예측하는 순전파에는 정밀도가 높은 E4M3을, 기울기를 계산하는 역전파에는 범위가 넓은 E5M2를 쓴다. FP8 가중치 텐서 옆에 32비트 크기 조정 값을 함께 저장해 값이 범위를 넘거나 모자라는 것을 막고, 텐서를 곱할 때 이 값을 함께 계산한다. 사전학습을 마친 뒤에는 과제별 미세조정과 큰 모델을 작은 모델로 옮기는 증류, 강화학습을 하고 여러 병렬화 방식을 써서 많은 GPU를 쓴다. 추론 단계에서는 NVIDIA TensorRT LLM이 학습된 가중치로 엔진을 만들고 커널 융합과 최적화한 CUDA 코드, KV 캐시, 요청을 이어 붙이는 배치 처리를 적용한다. 품질 확인은 매개변수 15억 개 모델을 3조 토큰으로 두 형식에서 각각 학습해 학습 손실과 영어 독일어 검증 perplexity를 비교하는 방식으로 했다.

성과

DeepL은 학습이 쓰는 연산 자원 활용도를 뜻하는 MFU가 44.6%에서 FP8로 67%까지 올라 학습이 50% 빨라졌다고 밝혔다. 다른 학습 구성에서는 NVIDIA와 함께 Transformer Engine 사용을 다듬어 15개월 동안 25%를 더 올려 80% MFU에 이르렀다고 설명했다. 품질에서는 학습 손실이 BF16 쪽이 아주 조금 낮았지만 그 차이가 단계마다의 변동에 묻힐 정도였고, 영어와 독일어 검증 perplexity에서는 저하가 없었다고 밝혔다. 추론에서는 대부분의 배치 크기에서 BF16과 같은 지연 시간으로 두 배의 처리량을 냈다고 설명했다. 이 회사는 그 결과로 매개변수가 훨씬 많은 모델을 만들어 이전 모델보다 유럽 언어에서 1.4배, 영어와 일본어처럼 어려운 언어 조합에서 1.7배 나은 번역을 내면서도 운영 추론의 같은 지연 시간 안에 들어간다고 밝혔다. 품질 판단은 언어 전문가가 했다고 설명했다.

한계와 남은 과제

이전 모델보다 1.4배와 1.7배 낫다는 값을 어떤 평가 방법으로 몇 건을 비교해 얻었는지 원문에 없다. FP8을 운영 추론에 처음 적용한 시점도 원문에 없다. 번역 품질을 판단한 언어 전문가의 수와 평가 기준도 원문에 없다.

출처

공개된 자료를 정리한 사례입니다. ATF Works 도입 고객의 결과가 아닙니다.

원문 보기 (새 탭에서 열림)