Score Centering Stabilizes Off-policy Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 1095
- 분야
- Machine Learning
- arXiv 번호
- 2609.20807
LLM 강화학습에서 학습 엔진과 추론 엔진의 미세한 차이가 쌓여 훈련이 무너지는 문제를, '스코어 센터링'이라는 덧셈 보정항 하나로 안정시킨 논문이다.
이 논문은 한마디로 LLM 강화학습(RL)이 무너지는 진짜 원인이 학습·추론 엔진 간 미세한 수치 차이가 매 스텝 쌓이는 '드리프트'임을 보이고, 이걸 상쇄하는 간단한 덧셈 보정항 '스코어 센터링'을 제안했다. 기존의 중요도 샘플링(확률 비율로 보정)은 분산이 커서 불안정했는데, 이 방법은 비율·클리핑 없이 그냥 스코어의 평균을 빼주기만 한다. 0.6B~30B 모델 실험에서 양자화(저정밀 연산)가 심해질수록 기존 방법보다 더 잘 버텼고, 중요도 샘플링과 같이 쓰면 효과가 더 컸다.
핵심 요약
- RL 불안정의 원인을 '드리프트'(엔진 간 편차가 훈련 스텝마다 누적되는 것)로 특정하고, 이를 상쇄하는 덧셈식 보정항을 수학적으로 유도했다.
- FP8/INT4 같은 저정밀 양자화 상황에서 800스텝 훈련 시, 스코어 센터링이 PPO·DAPO 등 주요 보정법들을 따라잡거나 앞질렀다.
- 비율 곱셈이 아니라 덧셈 보정이라 중요도 샘플링과 조합 가능하고, 조합 시 낡은 롤아웃(staleness) 실험에서 순수 중요도 샘플링보다 성적이 더 좋았다.
- Qwen3-0.6B(Countdown 게임)와 Qwen3-30B(수학 데이터)로 검증했고, 코드를 깃허브에 공개했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.