A Bitter Lesson for Data Filtering
- 발행일
- 출처
- arXiv
- 논문 번호
- 192
- 분야
- Machine Learning
- arXiv 번호
- 2605.19407
이 논문은 대형 언어 모델의 경우, 충분한 계산 자원과 모델 크기로 학습할 때 필터링되지 않은 Common Crawl 데이터가 필터링된 변형보다 더 나은 성능을 낼 수 있음을 실증적으로 입증한다.
이 연구는 계산량은 크지만 사용할 데이터가 부족한 사전학습 조건에서 데이터 필터의 효과가 모델 규모와 학습 길이에 따라 어떻게 바뀌는지 조사했다. Common Crawl의 원본과 여러 필터를 적용한 하위 집합을 만들고 모델 크기와 학습 단계를 함께 늘리며 손실을 비교했다. 충분히 큰 모델을 오래 학습하면 필터링하지 않은 데이터가 모든 시험 필터보다 좋아졌고, 무작위 문자열이나 단어 순서를 섞은 문서 같은 잡음에도 큰 모델이 예상보다 강했다. 저자들은 데이터 풀 크기와 모델 크기 및 학습 단계의 관계를 이용해 필터를 쓰지 않는 편이 유리해지는 계산량을 예측하는 스케일링 법칙도 제시했다. 다만 실험은 원본 전체가 아닌 표본 Common Crawl과 밀집 Transformer의 사전학습에 한정되고, 계산이 부족할 때는 여전히 필터링이 중요하다고 밝힌다.
핵심 요약
- 고정된 에폭 수로, 4 에폭 동안 학습한다.
- 파이프라인을 단순화한다. 복잡한 분류기와 휴리스틱 규칙에 수천 GPU 시간과 인간 엔지니어링 노력을 들이는 대신, 가공되지 않은 파싱된 웹 데이터에 학습 시간을 단순히 늘리는 것이 더 나은 수익을 가져올 수 있다.
- '쓰레기'에도 가치가 있다. 뒤섞인 데이터와 무작위 데이터에 대한 견고함은, 모델이 충분히 크다면 목표 분포와 관련된 통계적 신호를 일부라도 담고 있는 거의 모든 데이터가 유용할 수 있음을 시사한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.