WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
- 발행일
- 출처
- arXiv
- 논문 번호
- 1038
- 분야
- AI / General
- arXiv 번호
- 2608.27454
에이전트가 겪은 경험을 '위키'라는 영구 지식창고에 쌓아두고, 그 지식 위에서 스킬을 계속 진화시키는 구글의 프레임워크.
이 논문은 한마디로 에이전트의 실행 경험을 위키(영구 지식창고)에 쌓아서 스킬을 점점 좋게 만드는 WikiSkill 프레임워크다. 작업 공간을 원시 기록(Raw)·위키(Wiki)·스킬(Skill) 세 층으로 나누고, 매 반복마다 성공/실패 기록의 원인을 위키에 정리한 뒤 그 지식을 근거로 스킬을 수정한다. 검증 점수가 오르는 수정만 채택하는 규칙 덕에 성능이 나빠지지 않으면서 지식은 계속 쌓인다. 5개 벤치마크·5개 모델에서 기존 스킬 진화 방법(EvoSkill, SkillOpt)을 이겼고, 작은 모델이 스킬을 얹으면 3배 큰 모델을 이기기도 했다.
핵심 요약
- 실행 기록·지식·스킬을 세 층으로 분리하고, 위키층은 절대 초기화하지 않고 계속 쌓는 구조를 만들었다.
- 검증 성적이 오르는 스킬 수정만 채택하고 나빠지면 되돌리는 게이팅으로 안정적으로 진화시켰다.
- 5개 벤치마크(수학·검색·스프레드시트·문서QA·가정환경 과제)·5개 모델에서 기존 스킬 진화 방법을 일관되게 이겼다.
- 모델이 클수록 스킬 진화 효과가 커져서, Qwen 계열에서 4B/9B/27B가 각각 평균 +12.3/+17.5/+23.9% 올랐다.
- 9B 모델+WikiSkill(47.4%)이 스킬 없는 27B 모델(39.4%)을 이겼고, 남이 진화한 스킬이 자기 스킬보다 나은 경우도 있었다.
- 위키를 없애는 절임 실험에서 성능이 떨어져, 지식 축적이 효과의 핵심임을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.