Score Centering Stabilizes Off-policy Reinforcement Learning

발행일
출처
arXiv
논문 번호
1095
분야
Machine Learning
arXiv 번호
2609.20807

LLM 강화학습에서 학습 엔진과 추론 엔진의 미세한 차이가 쌓여 훈련이 무너지는 문제를, '스코어 센터링'이라는 덧셈 보정항 하나로 안정시킨 논문이다.

이 논문은 한마디로 LLM 강화학습(RL)이 무너지는 진짜 원인이 학습·추론 엔진 간 미세한 수치 차이가 매 스텝 쌓이는 '드리프트'임을 보이고, 이걸 상쇄하는 간단한 덧셈 보정항 '스코어 센터링'을 제안했다. 기존의 중요도 샘플링(확률 비율로 보정)은 분산이 커서 불안정했는데, 이 방법은 비율·클리핑 없이 그냥 스코어의 평균을 빼주기만 한다. 0.6B~30B 모델 실험에서 양자화(저정밀 연산)가 심해질수록 기존 방법보다 더 잘 버텼고, 중요도 샘플링과 같이 쓰면 효과가 더 컸다.

핵심 요약

  • RL 불안정의 원인을 '드리프트'(엔진 간 편차가 훈련 스텝마다 누적되는 것)로 특정하고, 이를 상쇄하는 덧셈식 보정항을 수학적으로 유도했다.
  • FP8/INT4 같은 저정밀 양자화 상황에서 800스텝 훈련 시, 스코어 센터링이 PPO·DAPO 등 주요 보정법들을 따라잡거나 앞질렀다.
  • 비율 곱셈이 아니라 덧셈 보정이라 중요도 샘플링과 조합 가능하고, 조합 시 낡은 롤아웃(staleness) 실험에서 순수 중요도 샘플링보다 성적이 더 좋았다.
  • Qwen3-0.6B(Countdown 게임)와 Qwen3-30B(수학 데이터)로 검증했고, 코드를 깃허브에 공개했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)