Strong Teacher Not Needed? On Distillation in LLM Pretraining

발행일
출처
arXiv
논문 번호
232
분야
Machine Learning
arXiv 번호
2605.23857

프린스턴 대학교의 연구진은 대규모 언어 모델 사전학습에서 지식 증류의 근본 가정들을 체계적으로 재검토하여, 더 약한 교사도 이점을 제공할 수 있고(예: 0.7B 교사가 1.7B 학생의 다운스트림 정확도를 1.3% 개선) 지나치게 강하거나 과도하게 학습된 교사는 때때로 학생 성능을 저하시킬 수 있음을 입증했다.

이 연구는 지식 증류에서 교사가 반드시 학생보다 크고 강해야 한다는 통념을 대규모 언어 모델 사전학습에서 다시 검토한다. 연구진은 0.7B부터 8.0B까지 네 가지 모델 크기와 10B부터 300B까지 여섯 가지 교사 학습 토큰 예산을 조합하고, 언어 모델 손실과 증류 손실의 비중도 바꿔 비교했다. 적절한 손실 혼합을 사용하면 학생보다 작거나 덜 학습된 교사도 더 큰 학생의 성능을 개선할 수 있었다. 반대로 교사 크기나 학습량을 계속 늘리면 이득이 포화되거나 줄어들어, 절대 성능보다 교사와 학생의 구조적 호환성이 중요했다. 증류의 이득은 학습 분포 안의 적합도보다 분포 밖 perplexity와 여러 후속 과제의 일반화에서 더 쉽게 나타났다.

핵심 요약

  • 다운스트림 정확도는 MMLU나 GSM8K 같은 벤치마크에서의 성능이다.
  • 완벽한 교사를 기다리지 말아야 한다. 더 큰 새 모델을 학습시키는 경우, 현재 보유한 최고 모델을 교사로 사용하는 것이 유익하며, 그 교사가 새 모델의 목표보다 더 작거나 덜 학습되었더라도 마찬가지다.
  • 호환성을 우선해야 한다. 학생과 구조적으로 유사한 적당히 강한 교사가 거대한 최신 모델보다 더 효과적일 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)