SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

발행일
출처
arXiv
논문 번호
796
분야
AI / General
arXiv 번호
2608.02287

공개 Agent Skill 2,000개에서 검증된 합성 과제와 실행 궤적을 자동으로 만들어, 모델이 스킬을 제대로 골라 쓰도록 학습시키는 파이프라인이다. 같은 파이프라인으로 별도 벤치마크 SkillEval도 만들었다.

Agent Skill은 절차 지식을 담은 패키지로 널리 퍼졌지만, 스킬을 쥐여준다고 모델이 그걸 알아보고 골라 쓰고 여러 개를 엮는 것은 아니다. SKT는 스킬 선별, 과제 합성과 검증, 궤적 수집과 검증의 3단계 파이프라인으로 학습 데이터를 만든다. 규칙 기반 검사와 에이전트 기반 검사를 함께 걸고 실패하면 피드백으로 고쳐 다시 만들며, 지정된 스킬을 실제로 다 쓴 성공 궤적만 남긴다. 공개 스킬 2,000개로 과제 패키지 4,000개와 검증된 궤적 27,164개를 만들어 Qwen3.5-9B와 Gemma 4 E4B-IT를 지도학습으로 미세조정했다. 네 개 벤치마크에서 일관되게 성능이 올랐고, 학습 스킬 수를 늘릴수록 점수가 단조 증가했으며 다른 실행 환경으로도 이득의 절반가량이 옮겨갔다.

핵심 요약

  • 공개 스킬 2,000개에서 과제 패키지 4,000개와 검증된 실행 궤적 27,164개를 만들었다. 학습 데이터와 겹치지 않는 별도 스킬 풀로 SkillEval 벤치마크도 같은 파이프라인으로 구성했다.
  • 학습 스킬 예산을 0, 100, 500, 1000, 2000으로 늘리자 Qwen3.5-9B의 SkillEval 점수가 55.24, 59.8, 67.4, 70.8, 72.48로 단조 증가했다.
  • 다른 실행 환경에서 학습해도 이득이 옮겨간다. OpenCode 궤적으로 학습한 모델이 DeepAgents에서 SkillsBench 4.94에서 9.29로 올랐다. 같은 환경 궤적으로 학습하면 13.62까지 오르는데, 그 개선폭의 50.1퍼센트를 지킨 셈이다.
  • 두 환경 궤적을 섞어 학습한 단일 체크포인트는 벤치마크와 실행 환경을 짝지은 8개 비교 전부에서 원본을 이겼다. 이득은 2.64점에서 18.81점 사이다. SkillEval은 OpenCode에서 55.24가 74.05로, DeepAgents에서 51.62가 69.96으로 올랐다.
  • 섞어 학습한 모델은 환경 전용 모델과 평균 점수 차이가 최대 2.71점이며, 8개 비교 중 3개에서는 오히려 앞섰다. 환경마다 따로 모델을 유지할 필요가 줄어든다는 뜻이다.
  • SkillsBench 77개 과제를 지정 스킬 개수로 나눠 보면 스킬 1개는 9.54에서 16.94, 2개는 3.95에서 20.72, 3개 이상은 4.04에서 12.08로 올랐다. 이득이 단일 스킬 과제에만 몰려 있지 않다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)