Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

발행일
출처
arXiv
논문 번호
839
분야
LLMs / NLP
arXiv 번호
2608.05139

LLM이 추론 과정에서 서로 다른 기술을 전환하는 능력을 측정하고 훈련하기 위해 스킬 엔트로피를 제안했다.

이 논문은 한마디로 LLM이 수학을 하다가 계획을 세우고 정보를 추출하는 식으로 '기술 전환'을 잘하는지 측정하고 훈련시키는 방법이다. 스킬 엔트로피는 기술 간 전환 난이도를 수치화하고, Skill2-Bench는 558개 기술·9개 도메인의 벤치마크다. 스킬 엔트로피 RL 훈련으로 Qwen3-4B 점수를 34.4%에서 68.4%로 올렸다.

핵심 요약

  • 스킬 엔트로피: 두 기술 사이 전환 난이도를 측정하는 방향성 있는 지표를 정의했다.
  • 558개 기술, 9개 도메인으로 구성된 Skill2-Bench 벤치마크를 구축했다.
  • 프론티어 모델들이 스킬 엔트로피가 높은 과제에서 정확도가 단조롭게 하락한다.
  • 스킬 엔트로피 RL로 Qwen3-4B를 34.4%에서 68.4%로, Qwen3-1.7B를 14.6%에서 40.1%로 개선했다.
  • OpenR1-Math 등 기존 학습 데이터에도 적용 가능한 재사용 가능한 훈련 신호다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)