Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 583
- 분야
- Machine Learning
- arXiv 번호
- 2607.07508
비동기 RL에서 GRPO의 group-wise 샘플링을 single-rollout로 대체한 SAO. GLM-5.2(750B) RL 파이프라인에 실배포되어 GRPO 대비 일관된 성능 향상을 달성했다.
SAO(Single-rollout Asynchronous Optimization)는 LLM 에이전트 강화학습에서 GRPO의 group-wise 샘플링이 비동기 훈련에 부적합한 문제를 해결한다. 프롬프트당 1개 롤아웃만 사용하고, 직접적인 토큰 수준 importance sampling과 양측 클리핑으로 안정성을 확보한다. 또한 skip-observation GAE로 multi-turn 에이전트 궤적의 observation 토큰 노이즈를 제거한다. SWE-Bench Verified, BeyondAIME, IMOAnswerBench에서 GRPO를 일관되게 능가하며, GLM-5.2(750B-A40B) 모델의 RL 파이프라인에 성공적으로 배포되었다.
핵심 요약
- GRPO의 group-wise 샘플링을 single-rollout로 대체하여 비동기 RL에서 대기 시간 제거 및 off-policy 감소
- 직접 양측 토큰 수준 클리핑(Direct Double-Sided IS): rollout log-prob를 직접 사용하여 old-policy 추적 비용 제거
- skip-observation GAE: multi-turn 에이전트 궤적에서 observation 토큰을 건너뛰고 action 간 advantage 계산
- value model을 actor보다 더 자주 업데이트 + frozen attention 파인튜닝으로 single-rollout 안정화
- GLM-5.2(750B-A40B) RL 파이프라인에 실배포: 약 1000 스텝 안정 학습 달성, GRPO 대비 일관된 성능 향상
- 모의 온라인 학습 환경에서 보상 기준 변경 시 빠른 적응 확인 → 비정상 환경 적응력 입증
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.