SkillOpt: Executive Strategy for Self-Evolving Agent Skills
- 발행일
- 출처
- arXiv
- 논문 번호
- 225
- 분야
- AI / General
- arXiv 번호
- 2605.23904
마이크로소프트 연구진은 대형 언어 모델을 위한 자연어 에이전트 스킬을 체계적으로 진화시키는 텍스트 공간 최적화 방법인 SkillOpt를 제안한다.
SkillOpt는 동결된 에이전트의 자연어 스킬 문서를 학습 가능한 외부 상태로 보고 반복적으로 최적화하는 방법이다. 별도의 최적화 모델이 점수가 매겨진 실행 궤적을 분석해 추가, 삭제, 교체 편집을 제안하고, 편집 폭을 제한한 뒤 보류 검증 점수가 실제로 좋아질 때만 반영한다. 거부된 편집 기록과 느린 메타 갱신을 사용해 안정성을 높이며, 배포할 때는 최종 스킬만 사용하므로 추가 모델 호출이 없다. 여섯 벤치마크와 일곱 대상 모델 및 세 실행 환경의 52개 평가 조합에서 모두 최고 또는 공동 최고를 기록했고, 만든 스킬은 모델 크기와 실행 환경 및 가까운 수학 벤치마크 사이에서도 전이됐다. 다만 신뢰할 수 있는 자동 점수와 보류 검증 자료가 필요하고 최적화 단계의 추가 롤아웃 비용이 들기 때문에, 주관적이거나 일회성인 작업에는 적용 이점이 작을 수 있다.
핵심 요약
- 교차 모델 전이: 대형 모델(예: GPT-4o)에 최적화된 스킬을 더 작은 모델(예: GPT-4o-mini)에 성공적으로 적용할 수 있다. 작은 모델은 종종 성능 향상의 상당 부분을 포착하는데, 이는 스킬이 작은 모델의 가중치에 결여된 일반적 절차 지식을 제공함을 시사한다.
- 교차 하네스 전이: 한 실행 환경(예: 기본 채팅 인터페이스)에서 학습된 스킬은 더 복잡한 에이전트 하네스(예: 코드 실행 샌드박스)로 옮겨졌을 때도 종종 유효하게 유지된다. 이는 학습된 규칙이 단지 학습 환경의 특정 형식적 특성을 이용하는 것이 아니라 과제 수준의 논리를 포착하고 있음을 나타낸다.
- 교차 벤치마크 전이: 한 데이터셋(예: OlympiadBench)에서 학습한 절차가 관련은 있으나 별개인 데이터셋(예: Omni-MATH)에서도 성능을 향상시키는 것으로 나타났으며, 이는 SkillOpt가 단순히 특정 학습 예제 집합에 과적합되는 것이 아님을 추가로 입증한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.