Understanding Reasoning from Pretraining to Post-Training
- 발행일
- 출처
- arXiv
- 논문 번호
- 657
- 분야
- Machine Learning
- arXiv 번호
- 2607.16097
사전학습 단계가 강화학습(RL) 후속학습에 어떤 영향을 미치는지 체스를 테스트베드로 사용해 정량적으로 밝혀낸 논문이다.
이 논문은 한마디로 사전학습과 RL 강화학습 사이의 관계를 체스로 실험하며 수학적으로 풀어낸 연구다. 5M~1B 파라미터 모델을 인간 체스 기보로 사전학습시키고, RL을 걸었더니 사전학습 손실이 RL 후 성능을 잘 예측했다. 더 깊이 분석하면, RL은 쉬운 문제에서는 기존 정답을 강화하고 어려운 문제에서는 새로운 정답을 발굴한다. 수학 도메인 1B 모델에서도 같은 패턴이 나타났다.
핵심 요약
- 5M~1B 파라미터 모델로 36가지 사전학습-RL 조합을 실험해, 사전학습 손실이 RL 후 성능을 예측하는 스케일링 법칙을 발견했다.
- RL은 쉬운 문제에서는 기존 정답의 확률을 높이고, 어려운 문제에서는 SFT 때 거의 없던 정답을 끌어냈다.
- 전체 컴퓨트 예산이 커질수록 RL에 더 많은 비중을 투자하는 것이 최적이라는 결과를 얻었다.
- 체스뿐 아니라 수학 도메인(1B 언어모델, 10B~200B 토큰)에서도 사전학습이 길수록 RL 효율이 좋아지는 패턴이 확인됐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.