Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks
- 발행일
- 출처
- arXiv
- 논문 번호
- 169
- 분야
- Agents / Skills / Self-Improvement
- arXiv 번호
- 2604.20987
다기관 연구팀은 LLM 에이전트가 구조화된 스킬을 자율적으로 발견·정제·재사용함으로써 복잡하고 장기적인 과제에서 성능을 지속적으로 개선할 수 있게 하는 프레임워크 COS-PLAY를 도입했다.
다기관 연구팀은 LLM 에이전트가 구조화된 스킬을 자율적으로 발견·정제·재사용함으로써 복잡하고 장기적인 과제에서 성능을 지속적으로 개선할 수 있게 하는 프레임워크 COS-PLAY를 도입했다. 이 시스템은 GPT-5.4를 상대로 한 다양한 1인용 게임에서 평균 보상이 25.1%를 초과하는 증가를 보였으며, 사회적 추론 과제에서도 강력한 성능을 유지했다.
핵심 요약
- 복잡하고 장기적인 환경에서 구조화된 스킬을 발견·보존·재사용함으로써 지속적으로 개선할 수 있는 자율 에이전트를 구축한다.
- 현재의 LLM 에이전트는 스킬 습득을 위해 큐레이션된 인간 데이터셋이나 광범위한 외부 피드백에 의존하는 경우가 많아 확장성과 적응성이 제한된다.
- 다양하고 미래의 과제에 걸쳐 스킬을 조직·정제하고 신뢰성 있게 검색하는 것은 기존 에이전트 아키텍처에 도전 과제가 된다.
- COS-PLAY 프레임워크는 궤적을 생성하는 의사결정 에이전트(LLM)와 이를 재사용 가능한 구조화된 스킬로 변환하는 스킬 뱅크 에이전트를 갖춘 멀티 에이전트 공진화 시스템을 도입한다.
- 스킬은 요약, 사전 조건, 계획, 성공/중단 기준 등의 프로토콜을 포함하는 재사용 가능하고 시간적으로 확장된 행동 추상화로 정의되며, 동적으로 진화하는 스킬 뱅크에 저장된다.
- 두 에이전트는 각각의 LoRA 어댑터와 함께 Group Relative Policy Optimization(GRPO)으로 최적화되어, 개선된 스킬이 의사결정을 향상시키고 더 나은 롤아웃이 스킬 학습을 정제하는 폐루프 공진화를 촉진한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.