Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference
- 발행일
- 출처
- arXiv
- 논문 번호
- 1072
- 분야
- AI / General
- arXiv 번호
- 2609.05275
레이어 드롭아웃(학습 때 층을 무작위로 건너뛰는 기법)을 제대로 튜닝하면 LLM 학습 비용을 최대 25% 아끼면서 성능은 유지되고, 추론까지 최대 1.55배 가속된다는 2400회 넘는 대규모 실증 연구.
이 논문은 한마디로 요즘 LLM 학습에서 사라진 '레이어 드롭아웃'을 제대로 설정하면 돈과 시간을 아낄 수 있다는 걸 증명한 연구다. 학습할 때 트랜스포머의 층(블록)을 확률적으로 건너뛰게 하되, 깊은 층에 더 많이 걸고 학습 후반으로 갈수록 약하게 거는 조합이 핵심이다. 2400번 넘는 실험(2.7억~82억 파라미터, 최대 1600억 토큰)으로 검증했고, 같은 학습 예산에서 오히려 손실이 낮아지면서 계산량은 최대 25% 절약됐다. 이렇게 학습한 모델은 층을 일부 생략해도 튼튼해서 추론 가속 기법과 결합해 최대 1.55배 빨라진다. 규모가 커질수록 효과가 확실해져서 대형 모델 학습법의 기본 레시피로 다시 쓸 만하다는 결론이다.
핵심 요약
- 2400번 넘는 학습 실험으로, 층이 깊어질수록 드롭아웃을 세게 걸고 학습이 진행될수록 약하게 거는 조합이 최적이라는 걸 찾아냈다.
- 같은 학습 예산에서 검증 손실이 dense(드롭아웃 없는 기준)와 비슷하거나 더 낮게 나오면서 계산량은 최대 25% 절약됐다.
- 82억 파라미터 모델에서 최대 드롭아웃 99%의 공격적 설정으로도 손실 1.663을 기록해 dense 기준(1.732)보다 좋았다.
- 드롭아웃으로 학습한 모델은 층을 생략해도 튼튼해서, 자기-추측 디코딩(모델이 직접 빠른 초안을 쓰고 검증하는 가속 기법)으로 최대 1.55배 빨라졌다.
- 반면 드롭아웃 없이 학습한 dense 모델은 층을 건너뛰면 손실이 6.446까지 폭증해 사실상 못 쓰는 점이 대비된다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.