Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention
- 발행일
- 출처
- arXiv
- 논문 번호
- 283
- 분야
- Machine Learning
- arXiv 번호
- 2605.29548
더 큰 모델이 왜 더 많이 학습하는지를 용량, 간섭, 희귀 과제 보존이라는 관점에서 분석한다.
더 큰 모델은 더 작은 모델이 학습하지 못하는 과제를 학습한다. 무엇이 이 현상을 일으키는가? 이 논문은 거듭제곱 법칙 스케일링이 이미, 무한한 학습 데이터가 있더라도 더 큰 모델이 더 작은 모델은 학습하지 못하는 데이터 분포의 일부를 학습할 수 있음을 시사한다는 단순한 현상론적 논증을 전개한다. 이 주장을 검증하고 그 원인을 규명하기 위해, 단조로운 스케일링 곡선을 보이는 과제들의 혼합으로 구성된 합성 설정에서 모델 스케일링의 효과를 연구한다. 그 결과는 자원(뉴런)을 둘러싼 데이터 유발 경쟁을 가리킨다. 구체적으로, 더 작은 모델은 뉴런을 고빈도이거나 저복잡도인 과제에 할당하므로, 희귀하고 복잡한 과제에서 성능이 떨어지는 해를 학습한다. 더욱이 이는 원하는 과제를 표현할 수 있는 해가 존재하는 경우에도 발생한다. 이어서 더 큰 모델이 이 데이터 중심적 병목을 어떻게 우회하는지 평가하며, 그것이 간섭 감소 메커니즘으로 거슬러 올라감을 발견한다. 즉, 더 큰 모델은 흔한 과제에 충분한 자원을 할당할 수 있어 해당 과제에 대한 그래디언트 업데이트가 약해지고, 그 결과 희귀 과제 특징이 천천히 축적되는 동안 그것을 덮어쓰지 않게 된다. 마지막으로, 이러한 주장을 더 검증하기 위해 다양한 빈도와 복잡도의 새로운 과제에 대해 OLMo 모델(4M부터 4B 파라미터)을 사전학습한다. 그 결과는 합성 데이터 실험의 결과를 반영한다. 즉, 더 큰 OLMo 모델만이 빈도가 낮고 복잡한 과제를 학습하며, 이 더 큰 모델들은 표현에 더 많은 과제 특징을 임베딩하고 과제 간 그래디언트 간섭을 더 적게 보인다. 종합적으로, 왜 더 큰 모델이 더 작은 모델이 실패하는 과제를 학습하는지에 대한 데이터 중심적 설명을 제시한다. 이는 실제로 더 큰 모델이 더 나은 이유를 설명하는 데 도움이 되며, 모델 크기 설정과 학습 데이터 혼합에 관한 실용적 질문에 정보를 줄 수 있다.
핵심 요약
- 그 결과는 자원(뉴런)을 둘러싼 데이터 유발 경쟁을 가리킨다.
- 이 논문은 거듭제곱 법칙 스케일링이 이미, 무한한 학습 데이터가 있더라도 더 큰 모델이 더 작은 모델은 학습하지 못하는 데이터 분포의 일부를 학습할 수 있음을 시사한다는 단순한 현상론적 논증을 전개한다.
- 이 주장을 검증하고 그 원인을 규명하기 위해, 단조로운 스케일링 곡선을 보이는 과제들의 혼합으로 구성된 합성 설정에서 모델 스케일링의 효과를 연구한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.