AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

발행일
출처
arXiv
논문 번호
083
분야
Agents / RL
arXiv 번호
2509.08755

오픈소스 프레임워크 AgentGym-RL은 다중 턴 강화학습과 ScalingInter-RL이라 불리는 점진적 상호작용 스케일링 전략을 통해, 장기적 의사결정을 위한 대규모 언어 모델 에이전트의 훈련을 가능하게 한다.

오픈소스 프레임워크 AgentGym-RL은 다중 턴 강화학습과 ScalingInter-RL이라 불리는 점진적 상호작용 스케일링 전략을 통해, 장기적 의사결정을 위한 대규모 언어 모델 에이전트의 훈련을 가능하게 한다. 이 접근법은 7B 파라미터 모델이 다양한 환경에서 더 큰 독점 모델에 견주거나 능가하는 평균 성공률을 달성하게 하여, RL 훈련이 에이전트 지능에 미치는 영향을 부각한다.

핵심 요약

  • 복잡하고 다중 턴이며 장기적인 과제를 위해 LLM 에이전트를 처음부터 훈련할 수 있는 통합적이고 상호작용형인 강화학습(RL) 프레임워크가 없다.
  • 프롬프팅이나 지도 미세조정(SFT) 같은 기존 LLM 에이전트 개발 방법은 흔히 독점 모델이나 인간이 선별한 데이터에 의존하여, 확장성과 적응성, 내재적 자기 개선을 제한한다.
  • LLM에 대한 전통적 RL 응용은 대부분 단일 턴 과제에 국한되거나, 다중 턴 에이전트 의사결정으로 확장될 때 불안정성과 비효율성 문제에 직면한다.
  • 다양한 다중 턴 장기적 과제를 지원하기 위해 환경, 에이전트, 훈련 모듈을 분리한 모듈식 오픈소스 프레임워크인 AgentGym-RL을 도입한다.
  • RL 훈련 중 최대 턴 수를 적응적으로 늘려 탐색과 활용의 균형을 맞춤으로써 최적화 안정성과 효율성을 개선하는, 새로운 점진적 상호작용 스케일링 전략 ScalingInter-RL을 개발한다.
  • 주류 온라인 RL 알고리즘(예: PPO, GRPO)을 지원하고 다양한 현실적 환경 전반의 확장성과 신뢰성을 위한 엔지니어링 최적화를 포함하는 통합 RL 파이프라인을 통합한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)