LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws
- 발행일
- 출처
- arXiv
- 논문 번호
- 228
- 분야
- Machine Learning
- arXiv 번호
- 2605.23901
ByteDance Seed, 버지니아대학교, 캘리포니아대학교 버클리의 연구진은 대형 언어 모델(LLM) 학습을 노이즈가 있는 채널을 통한 정보 전송으로 모델링하여 단조적 및 비단조적 스케일링 거동을 모두 설명하는 이론적 프레임워크인 섀넌 스케일링 법칙(Shannon Scaling Law)을 제안했다.
Shannon Scaling Law는 모델을 크게 하거나 학습 데이터를 늘려도 성능이 나빠질 수 있는 비단조 현상을 설명하려는 스케일링 법칙이다. 모델 매개변수를 통신 채널의 대역폭으로, 학습 토큰을 신호 세기로 대응시켜 대규모 언어 모델 학습을 잡음이 있는 정보 전달 과정으로 표현한다. 이 관점에서는 신호 대 잡음비를 충분히 유지하지 못한 확장이 잡음을 키워 손실 곡선을 U자형으로 바꿀 수 있다. Pythia와 OLMo2에 가우시안 잡음, 양자화, 여러 과제의 지도 미세조정을 적용한 실험에서 기존 단조 스케일링 법칙보다 손실 구간을 더 잘 맞췄다. 6.9B 이하 모델과 1,800억 토큰 이하 자료로 적합한 법칙이 보지 못한 12B 모델의 3,070억 토큰 지점까지 pooled R² 0.847로 예측해, 무조건적인 규모 확대보다 정보 밀도와 신호 대 잡음비 관리가 중요함을 시사한다.
핵심 요약
- 제거 불가능한 노이즈(e): Chinchilla류 법칙의 상수항에 해당하며, 스케일링과 무관하게 제거할 수 없는 근본적 구조적 한계 또는 시스템 엔트로피를 나타낸다.
- 전략적 스케일링: U자형 곡선의 존재는 주어진 노이즈 수준에서 N과 D를 스케일링하는 최적의 스위트 스폿이 있음을 시사한다. 무차별적 스케일링이 항상 답은 아니며, 개발자는 자신의 학습 설정의 신호 대 잡음비를 고려해야 한다.
- 노이즈 인식: 지수 분석 결과 데이터 노이즈가 종종 학습 신호보다 빠르게 증가하는 것으로(δ가 β보다 큼) 드러났다. 이는 데이터 큐레이션과 노이즈 완화의 결정적 중요성을 부각한다. 학습 데이터에 노이즈가 많다면 단순히 더 많이 추가하는 것은 결국 역효과를 낳는다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.