Self-Improving Pretraining: using post-trained models to pretrain better models
- 발행일
- 출처
- arXiv
- 논문 번호
- 172
- 분야
- LLMs / Pretraining / Safety
- arXiv 번호
- 2601.21343
Meta FAIR의 연구자들은 안전성, 사실성, 품질, 추론 같은 바람직한 행동을 대규모 언어 모델 훈련의 더 이른 단계에 통합하는 방법을 개발했다.
Meta FAIR의 연구자들은 안전성, 사실성, 품질, 추론 같은 바람직한 행동을 대규모 언어 모델 훈련의 더 이른 단계에 통합하는 방법을 개발했다. 이들의 접근법은 사후학습된 모델을 활용해 사전학습을 안내하고 명시적인 "사고" 중간학습 단계를 도입하며, 이를 통해 전통적 사후학습 대비 수학적 추론 정확도를 3.2배 높이는 등 내재적 역량이 향상된 모델을 만들어낸다.
핵심 요약
- 기존 LLM 훈련은 안전성, 사실성, 품질, 복잡한 추론 같은 핵심 행동의 도입을 사후학습 단계로 미룬다.
- 초기 사전학습 중에 학습된 패턴은 이러한 바람직한 속성에 대한 명시적 안내가 부족하여, 나중에 완전히 교정하기 어려운 지속적 약점을 야기한다.
- 사전학습 데이터에는 명시적 추론 흔적이 대체로 결여되어 있어, 복잡한 추론 능력 습득이 비용이 큰 사후학습에 주로 의존하게 되어 효율이 제한된다.
- "자기 개선 사전학습" 프레임워크는 사전학습을 시퀀스 생성 과제로 재정의하며, 더 강력한 사후학습 모델을 데이터 품질과 안전성을 개선하는 접미사 재작성기이자 훈련용 보상 신호를 제공하는 접미사 판정기로 활용한다.
- "사고 중간학습" 단계는 사전학습 데이터에 "사고"를 교차 삽입하여 보강하고 지도 미세조정을 적용한 뒤, 후속 텍스트 예측에서 생성된 사고의 유용성을 최적화하기 위해 강화학습을 수행한다.
- DPO나 RF-NLL 같은 온라인 강화학습 알고리즘을 사용하여, 판정기가 제공하는 보상에 기반해 더 높은 품질과 안전성과 사실성을 갖춘 접미사를 생성하도록 정책 모델을 훈련한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.