Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 839
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.05139
LLM이 추론 과정에서 서로 다른 기술을 전환하는 능력을 측정하고 훈련하기 위해 스킬 엔트로피를 제안했다.
이 논문은 한마디로 LLM이 수학을 하다가 계획을 세우고 정보를 추출하는 식으로 '기술 전환'을 잘하는지 측정하고 훈련시키는 방법이다. 스킬 엔트로피는 기술 간 전환 난이도를 수치화하고, Skill2-Bench는 558개 기술·9개 도메인의 벤치마크다. 스킬 엔트로피 RL 훈련으로 Qwen3-4B 점수를 34.4%에서 68.4%로 올렸다.
핵심 요약
- 스킬 엔트로피: 두 기술 사이 전환 난이도를 측정하는 방향성 있는 지표를 정의했다.
- 558개 기술, 9개 도메인으로 구성된 Skill2-Bench 벤치마크를 구축했다.
- 프론티어 모델들이 스킬 엔트로피가 높은 과제에서 정확도가 단조롭게 하락한다.
- 스킬 엔트로피 RL로 Qwen3-4B를 34.4%에서 68.4%로, Qwen3-1.7B를 14.6%에서 40.1%로 개선했다.
- OpenR1-Math 등 기존 학습 데이터에도 적용 가능한 재사용 가능한 훈련 신호다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.