Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

발행일
출처
arXiv
논문 번호
1012
분야
Machine Learning
arXiv 번호
2608.24814

이 논문은 LLM 사전학습에서 손실 곡선이 학습률과 파라미터 크기의 비율인 '실효 학습률(ELR)' 하나로 결정된다는 법칙을 발견했다.

이 논문은 한마디로 LLM 사전학습의 손실(오차) 곡선은 학습률(LR)을 파라미터 크기로 나눈 '실효 학습률(ELR)'이 지배한다는 실험 법칙을 밝혔다. 학습률과 파라미터 크기가 완전히 달라도 ELR 시간표만 같으면 손실 곡선이 거의 겹쳤다(오차 10^-3 수준으로, 시드를 바꿀 때 생기는 차이보다 작다). 웨이트 데케이(파라미터 크기를 서서히 줄여주는 기법) 같은 크기 제어도 결국 ELR을 바꿔서 손실에 영향을 준다는 것을 증명했다. ELR 좌표로 바꾸면 손실 곡선 예측식(스케일링 로우)이 크기 제어 방식이 달라도 그대로 쓸 수 있었고, 크기 제어가 나중에 역전하는 '늦은 가속' 현상의 원인도 ELR 감쇠로 설명했다.

핵심 요약

  • 학습률과 파라미터 크기를 각각 튜닝할 게 아니라, 비율인 ELR 시간표를 먼저 설계하라는 새 관점을 제시했다.
  • ELR만 맞추면 옵티마이저·아키텍처·데이터·모델 크기가 달라도 손실 곡선이 거의 일치했다(평균 오차 10^-3 수준).
  • 웨이트 데케이와 하이퍼볼(파라미터를 정해진 크기로 묶는 기법)의 손실 영향도 각각 만드는 ELR 시간표로 설명됐다.
  • ELR 기반 스케일링 로우는 크기 제어 방식이 달라도 예측이 통했다. 학습률 기반으로 두면 예측 오차가 12.9배 커졌다.
  • 이 법칙이 정확히 성립하는 조건(정규화 설계, 변화 속도)도 조건별 실험으로 짚어냈다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)