Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
- 발행일
- 출처
- arXiv
- 논문 번호
- 719
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.22529
LLM이 스킬(재사용 가능한 모듈)을 스스로 만들고 발전시키며 자기 학습하는 새 방법을 제안했다. 도구 사용 성능 최대 +42.9점, 논리 추론 +12.0점 향상.
이 논문은 한마디로 LLM이 스스로에게 도전 과제를 내고 풀면서, 그 과정에서 새로운 스킬을 배우고 기존 스킬을 개선하는 '스킬 자가 학습(Skill Self-Play)' 프레임워크다. 기존 방식은 좁은 영역만 학습하거나, 넓게 학습해도 품질 검증이 안 되는 딜레마가 있었다. 이 논문은 스킬(특정 작업을 처리하는 모듈)을 매개체로 삼아, 과제 다양성과 검증 신뢰성을 동시에 잡았다. Qwen3-4B 기준 도구 사용 정확도 +42.9점, 논리 추론 +12.0점의 성능 향상을 달성했다.
핵심 요약
- 스킬(재사용 가능한 작업 모듈)을 핵심 매개체로 삼아, 과제 다양성과 검증 신뢰성을 동시에 확보했다.
- 제안자(Proposer)-해결자(Solver)-스킬 관리자(Controller) 3자가 강화학습 루프에서 함께 진화한다.
- 스킬 라이브러리가 매 반복마다 약 20개의 새 스킬을 만들고, 기존 스킬을 업데이트하며, 쓸모없는 스킬은 폐기한다.
- Qwen3-4B 기준 도구 사용(BFCL)에서 최대 +42.9점, 논리 추론(ZebraLogic)에서 +12.0점의 성능 향상을 기록했다.
- 정적 스킬보다 동적 스킬 진화가 핵심이며, 스킬 없는 자가 학습 대비 전체 정확도 +2.6점을 추가로 확보했다.
- 처음에 정렬이 안 된 모델도 큰 폭으로 개선되는 '턴어라운드' 효과를 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.