Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 807
- 분야
- AI / General
- arXiv 번호
- 2608.01418
언어모델 강화학습에서 한 번 뽑은 롤아웃(모델이 문제마다 만들어 본 응답 묶음)을 여러 번 재사용할 때 생기는 오프폴리시 어긋남을 다룬 논문이다. 누적 중요도 비율 대신 앞 토큰들의 기하평균을 가중치로 쓰는 PNPO를 제안했다.
대규모 언어모델 강화학습에서 자기회귀 생성으로 롤아웃을 만드는 비용이 크기 때문에, 같은 롤아웃 배치를 여러 번 학습에 재사용해 비용을 나눠 쓰는 방법이 쓰인다. 그러나 학습자가 행동 정책에서 멀어지면서 뒤쪽 업데이트일수록 오프폴리시가 심해지고, 정확한 보정에 필요한 누적 중요도 비율은 곱 형태라 값의 범위가 지나치게 커진다. 저자들은 누적 비율 대신 각 위치까지의 인과적 앞부분 토큰 비율의 기하평균을 쓰는 PNPO를 제안했다. 롤아웃 배치당 학습 에폭을 1회와 4회로 두어 오프폴리시 정도가 다른 두 조건을 만들고 긴 문맥 수학 추론에서 비교했다. 1에폭에서는 GSPO와 비슷했지만 4에폭에서는 세 벤치마크 모두 최고 Avg@32를 얻었고 세 값 평균 50.24로 GSPO보다 3.00포인트 높았다.
핵심 요약
- PNPO는 각 토큰 위치까지의 우도비를 곱한 뒤 기하평균을 내어 인과적 앞부분 정보는 남기고 가중치 범위는 줄인다.
- 응답 전체에 한 가중치를 주는 GSPO와 달리 위치마다 다른 앞부분 평균을 쓰지만, 정확한 상태·행동 분포 보정은 포기한 편향된 근사다.
- 네 번 재사용한 조건에서 세 수학 벤치마크 평균 최고점은 50.24로 GSPO보다 3.00점 높았지만 한 번 학습 조건에서는 차이가 일관되지 않았다.
- 같은 2400회 갱신 예산에서 새 롤아웃 배치를 150개만 써도 한 번 학습으로 600개를 쓴 결과와 비슷해 롤아웃 재사용 가능성을 보였다.
- 모델 한 개와 수학 과제 세 개, 설정당 한 번 실행에 그쳤고 구성 요소를 따로 떼어 보지 않아 앞부분 정규화만의 효과와 비동기·재생 자료에서의 효과는 아직 분리되지 않았다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.