MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

발행일
출처
arXiv
논문 번호
252
분야
AI / General
arXiv 번호
2605.27366

MUSE-Autoskill은 대규모 언어 모델 에이전트가 재사용 가능한 자신의 스킬을 자율적으로 생성, 관리, 평가, 개선할 수 있게 하는 포괄적인 에이전트 프레임워크를 제시하며, 5단계 스킬 생애주기와 다층 메모리 시스템을 통합한다.

MUSE-Autoskill은 에이전트 스킬을 일회성 파일이 아니라 생성, 기억, 관리, 평가, 개선의 생애주기를 갖는 자산으로 다루는 프레임워크다. 에이전트는 필요한 스킬을 실행 중에 만들고, 작업별 경험을 스킬 메모리에 쌓으며, 단위 테스트와 실행 피드백으로 재사용 가능성을 점검한다. SkillsBench와 SkillLearnBench의 주요 설정에서 MUSE-Autoskill은 비교한 에이전트들보다 높은 성능을 기록했다. 생성에 성공한 작업만 보면 자체 스킬의 정확도가 85.24%로 같은 작업의 인간 작성 스킬 81.17%를 넘었고, Hermes로 옮긴 스킬도 51.90%의 정확도를 보였다. 다만 전체 성능을 제한한 주된 요인은 아직 쓸 수 있는 스킬을 만들지 못한 작업이 많다는 점이어서, 스킬 품질뿐 아니라 적용 범위를 넓히는 일이 중요하다.

핵심 요약

  • 테스트는 스킬이 Skill Bank에 들어가도록 허용되기 전에 스킬이 올바르게 작동하는지 검증하는 데 사용되는 단위 테스트다.
  • 메모리는 이전 실행에서 얻은 관찰과 교훈을 저장하는 고유한 파일(.memory.md)이다.
  • 레벨 1(단일 노드 압축)에서는 특정 도구 출력이 방대할 경우(예: 20,000 토큰 분량의 로그 파일), 주변 대화는 그대로 유지하면서 그것을 간결한 요약으로 대체한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)