Efficient Pre-Training with Token Superposition

발행일
출처
arXiv
논문 번호
188
분야
LLMs / Pretraining / Efficiency
arXiv 번호
2605.06546

대형 언어 모델의 사전학습은 대규모에서 종종 엄청나게 비싸고 비효율적이며, 높은 데이터 처리량을 달성하기 위해 복잡하고 침습적인 수정이 필요하다.

대형 언어 모델의 사전학습은 대규모에서 종종 엄청나게 비싸고 비효율적이며, 높은 데이터 처리량을 달성하기 위해 복잡하고 침습적인 수정이 필요하다. 이 논문은 병렬화, 옵티마이저, 토크나이저, 데이터, 모델 구조를 수정하지 않고도 사전학습 중 FLOPs당 데이터 처리량을 크게 향상시키는 간단한 드롭인 방법인 토큰 중첩 학습(TST)을 제시한다. TST는 두 단계로 이루어진다. 첫째는 다수의 연속된 토큰을 하나의 묶음으로 결합하여 멀티핫 교차 엔트로피(MCE) 목적함수로 학습하는 매우 효율적인 중첩 단계이고, 둘째는 표준 학습으로 되돌아가는 복구 단계다. 저자들은 270M 및 600M 파라미터 규모에서 TST를 광범위하게 평가하고 3B 및 10B A1B 전문가 혼합 모델에서 검증하여, 다양한 설정에서 매우 견고함을 입증한다. 궁극적으로 TST는 베이스라인 손실과 다운스트림 평가를 일관되게 능가하며, 동일 손실 설정에서 10B A1B 규모의 총 사전학습 시간을 최대 2.5배까지 단축한다.

핵심 요약

  • 대형 언어 모델의 사전학습은 대규모에서 종종 엄청나게 비싸고 비효율적이며, 높은 데이터 처리량을 달성하기 위해 복잡하고 침습적인 수정이 필요하다.
  • 이 논문은 병렬화, 옵티마이저, 토크나이저, 데이터, 모델 구조를 수정하지 않고도 사전학습 중 FLOPs당 데이터 처리량을 크게 향상시키는 간단한 드롭인 방법인 토큰 중첩 학습(TST)을 제시한다.
  • TST는 두 단계로 이루어진다. 첫째는 다수의 연속된 토큰을 하나의 묶음으로 결합하여 멀티핫 교차 엔트로피(MCE) 목적함수로 학습하는 매우 효율적인 중첩 단계이고, 둘째는 표준 학습으로 되돌아가는 복구 단계다.
  • 저자들은 270M 및 600M 파라미터 규모에서 TST를 광범위하게 평가하고 3B 및 10B A1B 전문가 혼합 모델에서 검증하여, 다양한 설정에서 매우 견고함을 입증한다.
  • 궁극적으로 TST는 베이스라인 손실과 다운스트림 평가를 일관되게 능가하며, 동일 손실 설정에서 10B A1B 규모의 총 사전학습 시간을 최대 2.5배까지 단축한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)