Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

발행일
출처
arXiv
논문 번호
1081
분야
Machine Learning
arXiv 번호
2609.11917

전문가 혼합 모델은 같은 학습 데이터를 반복해서 사용할 때 일반 밀집 모델보다 과적합이 빠르게 심해질 수 있다.

이 연구는 학습 자료가 부족해 같은 데이터를 여러 번 사용할 때 전문가 혼합 모델이 얼마나 잘 버티는지 살펴본다. 연구진은 데이터 반복 횟수와 분야, 전문가 수와 크기를 바꾸면서 일반 밀집 모델과 비교했다. 실험에서는 전문가 혼합 모델의 성능이 반복 학습에 더 민감했고, 이 경향은 실제 계산에 쓰이는 매개변수보다 전체 매개변수 수와 더 밀접했다. 학습 중 일부 출력을 가리는 방법은 과적합을 줄였지만, 모두 서로 다른 데이터로 학습한 성능을 완전히 회복하지는 못했다. 따라서 학습 비용을 줄이기 위해 전문가 혼합 구조를 선택할 때는 계산량뿐 아니라 확보한 고유 데이터의 양과 반복 정도도 함께 고려해야 한다.

핵심 요약

  • 연구진은 활성 매개변수 8천만 개부터 10억 개까지의 모델에서 데이터 반복률, 분야별 혼합 비율, 전문가 수와 크기를 바꾸어 비교했다.
  • 활성 매개변수 8천만 개 규모의 실험에서는 전문가 혼합 모델이 데이터를 네 번 반복할 때부터 성능 저하를 보였고, 높은 반복률에서는 밀집 모델에 대한 성능 우위를 잃었다.
  • 전문가 선택 경로가 학습 초기에 고정되는 현상과 반복 데이터에 대한 전문가의 과도한 특화가 관찰되어, 과적합을 이해하는 단서를 제공했다.
  • 드롭아웃과 출력 가리기는 반복 학습의 피해를 완화했으며, 데이터가 제한된 환경에서는 모델 구조와 함께 이런 과적합 완화 방법을 검토할 필요가 있음을 보여준다.
  • 실험한 완화 방법 중 어느 것도 고유 데이터만 사용한 학습 성능을 완전히 재현하지 못했으므로, 반복 학습을 새 데이터 확보의 완전한 대체 수단으로 볼 수는 없다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)