Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
- 발행일
- 출처
- arXiv
- 논문 번호
- 990
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.23311
이 논문은 LLM 강화학습에서 통제받지 않고 흔들리던 '입력(질문) 분포'를 직접 묶어주는 새 규제(Query-KL)로, 기존 정책 KL 대비 정확도와 훈련 안정성을 함께 높였다.
이 논문은 한마디로 LLM 강화학습의 불안정성을 '질문 쪽'에서 잡은 연구다. 기존 방법은 모델의 답변 분포만 기준 모델에 묶어두지만, 훈련이 진행되는 동안 모델이 부여하는 질문 확률도 조용히 표류한다. ERPO는 이 질문 분포의 이탈을 Query-KL로 묶는 대신, 답변 탐색은 자유롭게 두었다. GRPO/PPO에 추가 순전파 없이 붙일 수 있고, 수학 벤치마크 6종에서 정확도가 더 높아지며 고온 샘플링·장기 훈련에서도 흔들림이 크게 줄었다.
핵심 요약
- 기존 강화학습이 답변 분포만 규제하는 사이 질문 분포는 통제 없이 표류한다는 문제를 정식화했다.
- Query-KL이라는 입력쪽 규제를 추가해, 답변 탐색의 자유는 유지하면서 훈련 환경의 표류를 막았다.
- GRPO·PPO·REINFORCE 파이프라인에 추가 순전파 없이 최소 수정으로 붙일 수 있다.
- 수학 추론 벤치마크 6종에서 표준 Policy-KL 규제를 대체하며 정확도가 일관되게 올랐다.
- 다만 논문은 ERPO도 장기 훈련의 붕괴에서 완전히 자유롭지는 않고, 검증이 수학 추론 벤치마크와 Qwen 계열 모델에 머물러 대화나 코드 생성, 다국어 상황으로의 전이는 아직 확인하지 못했다고 밝힌다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.