Strong Teacher Not Needed? On Distillation in LLM Pretraining
- 발행일
- 출처
- arXiv
- 논문 번호
- 232
- 분야
- Machine Learning
- arXiv 번호
- 2605.23857
프린스턴 대학교의 연구진은 대규모 언어 모델 사전학습에서 지식 증류의 근본 가정들을 체계적으로 재검토하여, 더 약한 교사도 이점을 제공할 수 있고(예: 0.7B 교사가 1.7B 학생의 다운스트림 정확도를 1.3% 개선) 지나치게 강하거나 과도하게 학습된 교사는 때때로 학생 성능을 저하시킬 수 있음을 입증했다.
이 연구는 지식 증류에서 교사가 반드시 학생보다 크고 강해야 한다는 통념을 대규모 언어 모델 사전학습에서 다시 검토한다. 연구진은 0.7B부터 8.0B까지 네 가지 모델 크기와 10B부터 300B까지 여섯 가지 교사 학습 토큰 예산을 조합하고, 언어 모델 손실과 증류 손실의 비중도 바꿔 비교했다. 적절한 손실 혼합을 사용하면 학생보다 작거나 덜 학습된 교사도 더 큰 학생의 성능을 개선할 수 있었다. 반대로 교사 크기나 학습량을 계속 늘리면 이득이 포화되거나 줄어들어, 절대 성능보다 교사와 학생의 구조적 호환성이 중요했다. 증류의 이득은 학습 분포 안의 적합도보다 분포 밖 perplexity와 여러 후속 과제의 일반화에서 더 쉽게 나타났다.
핵심 요약
- 다운스트림 정확도는 MMLU나 GSM8K 같은 벤치마크에서의 성능이다.
- 완벽한 교사를 기다리지 말아야 한다. 더 큰 새 모델을 학습시키는 경우, 현재 보유한 최고 모델을 교사로 사용하는 것이 유익하며, 그 교사가 새 모델의 목표보다 더 작거나 덜 학습되었더라도 마찬가지다.
- 호환성을 우선해야 한다. 학생과 구조적으로 유사한 적당히 강한 교사가 거대한 최신 모델보다 더 효과적일 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.