Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention

발행일
출처
arXiv
논문 번호
283
분야
Machine Learning
arXiv 번호
2605.29548

더 큰 모델이 왜 더 많이 학습하는지를 용량, 간섭, 희귀 과제 보존이라는 관점에서 분석한다.

더 큰 모델은 더 작은 모델이 학습하지 못하는 과제를 학습한다. 무엇이 이 현상을 일으키는가? 이 논문은 거듭제곱 법칙 스케일링이 이미, 무한한 학습 데이터가 있더라도 더 큰 모델이 더 작은 모델은 학습하지 못하는 데이터 분포의 일부를 학습할 수 있음을 시사한다는 단순한 현상론적 논증을 전개한다. 이 주장을 검증하고 그 원인을 규명하기 위해, 단조로운 스케일링 곡선을 보이는 과제들의 혼합으로 구성된 합성 설정에서 모델 스케일링의 효과를 연구한다. 그 결과는 자원(뉴런)을 둘러싼 데이터 유발 경쟁을 가리킨다. 구체적으로, 더 작은 모델은 뉴런을 고빈도이거나 저복잡도인 과제에 할당하므로, 희귀하고 복잡한 과제에서 성능이 떨어지는 해를 학습한다. 더욱이 이는 원하는 과제를 표현할 수 있는 해가 존재하는 경우에도 발생한다. 이어서 더 큰 모델이 이 데이터 중심적 병목을 어떻게 우회하는지 평가하며, 그것이 간섭 감소 메커니즘으로 거슬러 올라감을 발견한다. 즉, 더 큰 모델은 흔한 과제에 충분한 자원을 할당할 수 있어 해당 과제에 대한 그래디언트 업데이트가 약해지고, 그 결과 희귀 과제 특징이 천천히 축적되는 동안 그것을 덮어쓰지 않게 된다. 마지막으로, 이러한 주장을 더 검증하기 위해 다양한 빈도와 복잡도의 새로운 과제에 대해 OLMo 모델(4M부터 4B 파라미터)을 사전학습한다. 그 결과는 합성 데이터 실험의 결과를 반영한다. 즉, 더 큰 OLMo 모델만이 빈도가 낮고 복잡한 과제를 학습하며, 이 더 큰 모델들은 표현에 더 많은 과제 특징을 임베딩하고 과제 간 그래디언트 간섭을 더 적게 보인다. 종합적으로, 왜 더 큰 모델이 더 작은 모델이 실패하는 과제를 학습하는지에 대한 데이터 중심적 설명을 제시한다. 이는 실제로 더 큰 모델이 더 나은 이유를 설명하는 데 도움이 되며, 모델 크기 설정과 학습 데이터 혼합에 관한 실용적 질문에 정보를 줄 수 있다.

핵심 요약

  • 그 결과는 자원(뉴런)을 둘러싼 데이터 유발 경쟁을 가리킨다.
  • 이 논문은 거듭제곱 법칙 스케일링이 이미, 무한한 학습 데이터가 있더라도 더 큰 모델이 더 작은 모델은 학습하지 못하는 데이터 분포의 일부를 학습할 수 있음을 시사한다는 단순한 현상론적 논증을 전개한다.
  • 이 주장을 검증하고 그 원인을 규명하기 위해, 단조로운 스케일링 곡선을 보이는 과제들의 혼합으로 구성된 합성 설정에서 모델 스케일링의 효과를 연구한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)