LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws

발행일
출처
arXiv
논문 번호
228
분야
Machine Learning
arXiv 번호
2605.23901

ByteDance Seed, 버지니아대학교, 캘리포니아대학교 버클리의 연구진은 대형 언어 모델(LLM) 학습을 노이즈가 있는 채널을 통한 정보 전송으로 모델링하여 단조적 및 비단조적 스케일링 거동을 모두 설명하는 이론적 프레임워크인 섀넌 스케일링 법칙(Shannon Scaling Law)을 제안했다.

Shannon Scaling Law는 모델을 크게 하거나 학습 데이터를 늘려도 성능이 나빠질 수 있는 비단조 현상을 설명하려는 스케일링 법칙이다. 모델 매개변수를 통신 채널의 대역폭으로, 학습 토큰을 신호 세기로 대응시켜 대규모 언어 모델 학습을 잡음이 있는 정보 전달 과정으로 표현한다. 이 관점에서는 신호 대 잡음비를 충분히 유지하지 못한 확장이 잡음을 키워 손실 곡선을 U자형으로 바꿀 수 있다. Pythia와 OLMo2에 가우시안 잡음, 양자화, 여러 과제의 지도 미세조정을 적용한 실험에서 기존 단조 스케일링 법칙보다 손실 구간을 더 잘 맞췄다. 6.9B 이하 모델과 1,800억 토큰 이하 자료로 적합한 법칙이 보지 못한 12B 모델의 3,070억 토큰 지점까지 pooled R² 0.847로 예측해, 무조건적인 규모 확대보다 정보 밀도와 신호 대 잡음비 관리가 중요함을 시사한다.

핵심 요약

  • 제거 불가능한 노이즈(e): Chinchilla류 법칙의 상수항에 해당하며, 스케일링과 무관하게 제거할 수 없는 근본적 구조적 한계 또는 시스템 엔트로피를 나타낸다.
  • 전략적 스케일링: U자형 곡선의 존재는 주어진 노이즈 수준에서 N과 D를 스케일링하는 최적의 스위트 스폿이 있음을 시사한다. 무차별적 스케일링이 항상 답은 아니며, 개발자는 자신의 학습 설정의 신호 대 잡음비를 고려해야 한다.
  • 노이즈 인식: 지수 분석 결과 데이터 노이즈가 종종 학습 신호보다 빠르게 증가하는 것으로(δ가 β보다 큼) 드러났다. 이는 데이터 큐레이션과 노이즈 완화의 결정적 중요성을 부각한다. 학습 데이터에 노이즈가 많다면 단순히 더 많이 추가하는 것은 결국 역효과를 낳는다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)