Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
- 발행일
- 출처
- arXiv
- 논문 번호
- 1053
- 분야
- Machine Learning
- arXiv 번호
- 2608.31046
온폴리시 증류(OPD)의 성능 향상이 사실은 교사 지식 전이가 아니라 '저확률 토큰 억제' 효과임을 밝히고, 교사 없이 자기 신호만으로 모델을 강화하는 OPSA를 제안했다.
이 논문은 한마디로 '증류가 아니라 자기 정리'임을 보인 반전 규명이다. 온폴리시 증류(OPD)에서 강한 교사 모델의 채점은 최대 50%까지 노이즈인데도 학생 모델은 아무렇지 않게 성장했고, 원인을 추적하니 학생이 뽑은 저확률 토큰을 억제하는 효과가 진짜였다. 저자들은 교사·보상·정답 힌트 없이, 토큰의 불확실성(엔트로피)에 맞춰 벌점 세기를 조절하는 OPSA를 만들었다. Qwen3-1.7B에서 AIME24 Avg@32를 기본 대비 263% 끌어올렸고 OPD보다 16.77점 높았다.
핵심 요약
- OPD의 교사 신호가 4B 교사 30.6%, 235B 교사 50.6%까지 노이즈(정답에 벌점, 오답에 점수)였는데, 노이즈를 지우고 학습해도 결과가 사실상 같았다.
- OPD의 이득은 저확률 토큰에 집중되며, 고정된 음의 어드밴티지 하나로 교사 신호를 대체할 수 있음을 보였다.
- 외부 감독이 전혀 없는 OPSA는 AIME24 Avg@32를 +35.41점(상대 263%) 올렸고 OPD보다 16.77점 높았다.
- 3개 수학 벤치마크(AIME24/25, HMMT) 모두에서 Pass@32를 두 배 이상 늘렸다.
- 확률이 갈리는 고엔트로피 분기점에서는 후보 토큰에 확률을 골고루 나눠, 분포를 날카롭게 만들면서도 탐색 다양성을 유지했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.