Scaling Domain Data Repetition in LLM Pretraining
- 발행일
- 출처
- arXiv
- 논문 번호
- 919
- 분야
- AI / General
- arXiv 번호
- 2608.14071
고품질 데이터를 몇 번 되풀이할지는 데이터 양보다 그 분야가 얼마나 안정적으로 학습되는지가 더 좋은 단서였다.
이 논문은 한마디로 대규모 언어 모델을 사전 학습할 때 제한된 전문 데이터를 몇 번 반복해야 하는지 조사한다. 모델 매개변수 하나당 학습 토큰 수인 TPP를 고정하고 코드, 수학, 위키와 의료 데이터를 반복해 넣었다. 적정 반복 횟수는 분야별 최소 검증 손실과 가장 강하게 관련됐고, 같은 TPP에서는 모델이 커질수록 조금 늘었다. 시험한 데이터 비율 범위에서는 고유 전문 데이터의 양 자체가 적정 횟수와 거의 관련이 없었다. 따라서 작은 시험 모델에서 찾은 안전한 반복 횟수를 큰 모델의 보수적인 기준으로 쓸 수 있다고 제안한다.
핵심 요약
- 코드, 수학, 위키와 의료 4개 분야를 시험했다. 고유 전문 데이터 비율은 전체 학습량의 2.5퍼센트, 5퍼센트와 10퍼센트로 두고 각 데이터를 1회부터 7회까지 반복했다.
- 적정 반복 횟수와 최소 검증 손실의 피어슨 상관계수는 마이너스 0.944였다. 모델 크기와는 0.400, 고유 데이터 비율과는 0.018이었다.
- 수학 데이터의 적정 반복 횟수는 약 5회에서 6회였고 의료 데이터는 약 3회에서 4회였다. 같은 전문 데이터 총량에서 수학은 4회 반복까지 손실 증가가 작았지만 위키는 2회를 넘으면 성능 저하가 뚜렷했다.
- 수학 데이터와 일반 웹 데이터의 총비율을 고정하면, 반복 횟수가 바뀌어도 ArXiv와 뉴스 자료의 검증 손실은 대체로 안정적이었다. 학습률을 일찍 낮추면 더 적은 반복에서도 성능 저하가 시작됐다.
- 한 번의 학습에서는 전문 분야 하나만 반복했다. 여러 분야를 함께 반복할 때의 상호작용과 작은 모델 결과로 큰 모델의 정확한 반복 횟수를 예측하는 공식은 아직 제시하지 않았다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.