Quantifying Hyperparameter Transfer and the Importance of Embedding Layer Learning Rate
- 발행일
- 출처
- arXiv
- 논문 번호
- 203
- 분야
- Machine Learning
- arXiv 번호
- 2605.21486
한 정량적 프레임워크는 손실 예측 가능성, 전이 견고성, 점근적 손실 저하에 대한 지표를 사용해 대규모 신경망에서 하이퍼파라미터 전이 전략의 품질을 평가한다.
이 연구는 작은 모델에서 찾은 최적 하이퍼파라미터를 큰 모델로 옮기는 품질을 세 가지 지표로 정량화한다. 지표는 스케일링 법칙의 적합도, 외삽 오차에 대한 견고성, 파라미터화 선택이 만드는 점근적 손실 불이익을 측정한다. AdamW 학습에서 최대 업데이트 파라미터화가 표준 파라미터화보다 잘 전이되는 가장 큰 이유는 임베딩 층 학습률을 충분히 크게 쓸 수 있기 때문으로 나타났다. 표준 파라미터화에서도 임베딩 학습률을 모델 너비만큼 키우면 학습 불안정이 줄고 전이 성능이 좋아졌다. 가중치 감쇠는 스케일링 법칙의 적합도를 높였지만 토큰 수를 파라미터 수에 맞춰 고정한 조건에서는 외삽 견고성을 낮추는 상반된 효과를 보였다.
핵심 요약
- LayerNorm LR: SP는 Θ(1/n)을 사용하고, μP는 Θ(1)을 사용한다.
- 어텐션 스케일링: SP는 1/d를 사용하고, μP는 1/d를 사용한다.
- 고정 스텝: 너비와 무관하게 일정한 반복 횟수로 학습한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.