Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

발행일
출처
arXiv
논문 번호
583
분야
Machine Learning
arXiv 번호
2607.07508

비동기 RL에서 GRPO의 group-wise 샘플링을 single-rollout로 대체한 SAO. GLM-5.2(750B) RL 파이프라인에 실배포되어 GRPO 대비 일관된 성능 향상을 달성했다.

SAO(Single-rollout Asynchronous Optimization)는 LLM 에이전트 강화학습에서 GRPO의 group-wise 샘플링이 비동기 훈련에 부적합한 문제를 해결한다. 프롬프트당 1개 롤아웃만 사용하고, 직접적인 토큰 수준 importance sampling과 양측 클리핑으로 안정성을 확보한다. 또한 skip-observation GAE로 multi-turn 에이전트 궤적의 observation 토큰 노이즈를 제거한다. SWE-Bench Verified, BeyondAIME, IMOAnswerBench에서 GRPO를 일관되게 능가하며, GLM-5.2(750B-A40B) 모델의 RL 파이프라인에 성공적으로 배포되었다.

핵심 요약

  • GRPO의 group-wise 샘플링을 single-rollout로 대체하여 비동기 RL에서 대기 시간 제거 및 off-policy 감소
  • 직접 양측 토큰 수준 클리핑(Direct Double-Sided IS): rollout log-prob를 직접 사용하여 old-policy 추적 비용 제거
  • skip-observation GAE: multi-turn 에이전트 궤적에서 observation 토큰을 건너뛰고 action 간 advantage 계산
  • value model을 actor보다 더 자주 업데이트 + frozen attention 파인튜닝으로 single-rollout 안정화
  • GLM-5.2(750B-A40B) RL 파이프라인에 실배포: 약 1000 스텝 안정 학습 달성, GRPO 대비 일관된 성능 향상
  • 모의 온라인 학습 환경에서 보상 기준 변경 시 빠른 적응 확인 → 비정상 환경 적응력 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)