AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 083
- 분야
- Agents / RL
- arXiv 번호
- 2509.08755
오픈소스 프레임워크 AgentGym-RL은 다중 턴 강화학습과 ScalingInter-RL이라 불리는 점진적 상호작용 스케일링 전략을 통해, 장기적 의사결정을 위한 대규모 언어 모델 에이전트의 훈련을 가능하게 한다.
오픈소스 프레임워크 AgentGym-RL은 다중 턴 강화학습과 ScalingInter-RL이라 불리는 점진적 상호작용 스케일링 전략을 통해, 장기적 의사결정을 위한 대규모 언어 모델 에이전트의 훈련을 가능하게 한다. 이 접근법은 7B 파라미터 모델이 다양한 환경에서 더 큰 독점 모델에 견주거나 능가하는 평균 성공률을 달성하게 하여, RL 훈련이 에이전트 지능에 미치는 영향을 부각한다.
핵심 요약
- 복잡하고 다중 턴이며 장기적인 과제를 위해 LLM 에이전트를 처음부터 훈련할 수 있는 통합적이고 상호작용형인 강화학습(RL) 프레임워크가 없다.
- 프롬프팅이나 지도 미세조정(SFT) 같은 기존 LLM 에이전트 개발 방법은 흔히 독점 모델이나 인간이 선별한 데이터에 의존하여, 확장성과 적응성, 내재적 자기 개선을 제한한다.
- LLM에 대한 전통적 RL 응용은 대부분 단일 턴 과제에 국한되거나, 다중 턴 에이전트 의사결정으로 확장될 때 불안정성과 비효율성 문제에 직면한다.
- 다양한 다중 턴 장기적 과제를 지원하기 위해 환경, 에이전트, 훈련 모듈을 분리한 모듈식 오픈소스 프레임워크인 AgentGym-RL을 도입한다.
- RL 훈련 중 최대 턴 수를 적응적으로 늘려 탐색과 활용의 균형을 맞춤으로써 최적화 안정성과 효율성을 개선하는, 새로운 점진적 상호작용 스케일링 전략 ScalingInter-RL을 개발한다.
- 주류 온라인 RL 알고리즘(예: PPO, GRPO)을 지원하고 다양한 현실적 환경 전반의 확장성과 신뢰성을 위한 엔지니어링 최적화를 포함하는 통합 RL 파이프라인을 통합한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.