Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 549
- 분야
- Distributed Systems
- arXiv 번호
- 2607.01120
기업 수준 자가진화 에이전트를 위한 차세대 agentic RL 시스템 아키텍처를 제안. 표준 궤적 데이터 프로토콜, 데이터 프록시, 진화 제어면 3대 축을 정의한다.
본 논문은 자가진화 LLM 에이전트가 기업 환경에 배포되기 위해 부족한 것이 알고리즘이나 모델이 아니라 시스템 기반이라고 주장한다. 세 가지 핵심 기둥을 제안한다: (1) 이기종 에이전트 패러다임 간 step 수준 학습 신호를 전달하는 표준 궤적 데이터 프로토콜(ATDP), (2) 실제 워크로드를 학습 가능한 데이터로 변환하는 기업급 데이터 프록시, (3) 궤적 통계 기반으로 메모리 삽입·스킬 패치·하니스 수정·가중치 업데이트를 자동 선택하는 진화 제어면. AREAL2.0 프로토타입으로 정책 가중치 업데이트 분기를 구현하여 입증한다.
핵심 요약
- 자가진화 에이전트의 병목은 RL 알고리즘이 아니라 시스템 기반(ATDP·데이터 프록시·진화 제어면)이라는 핵심 주장
- ATDP: step 수준 의사결정 맥락, 액션, 결과, 지연 보상, 거버넌스 메타데이터를 포함하는 벤더 중립 프로토콜 제안
- 진화 제어면: 궤적 통계·평가 점수·사용자 정정률·비용·안전 제약을 기반으로 메모리/스킬/하니스/가중치/롤백 중 자동 선택
- AREAL2.0: 기존 RL 프레임워크를 온라인 에이전트 서비스 지향 RL 루프로 재조직한 프로토타입 — gateway 교체만으로 에이전트 서비스의 LLM 호출을 RL 학습 루프로 편입
- OpenClaw를 개인용 자가진화 에이전트의 사례로 인용하며, 기업 수준 거버넌스와의 격차를 분석
- 자가진화를 단순 가중치 업데이트가 아닌 복합 정책(LLM+하니스+메모리+도구)의 다면적 개선으로 정의
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.