Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement

발행일
출처
arXiv
논문 번호
1053
분야
Machine Learning
arXiv 번호
2608.31046

온폴리시 증류(OPD)의 성능 향상이 사실은 교사 지식 전이가 아니라 '저확률 토큰 억제' 효과임을 밝히고, 교사 없이 자기 신호만으로 모델을 강화하는 OPSA를 제안했다.

이 논문은 한마디로 '증류가 아니라 자기 정리'임을 보인 반전 규명이다. 온폴리시 증류(OPD)에서 강한 교사 모델의 채점은 최대 50%까지 노이즈인데도 학생 모델은 아무렇지 않게 성장했고, 원인을 추적하니 학생이 뽑은 저확률 토큰을 억제하는 효과가 진짜였다. 저자들은 교사·보상·정답 힌트 없이, 토큰의 불확실성(엔트로피)에 맞춰 벌점 세기를 조절하는 OPSA를 만들었다. Qwen3-1.7B에서 AIME24 Avg@32를 기본 대비 263% 끌어올렸고 OPD보다 16.77점 높았다.

핵심 요약

  • OPD의 교사 신호가 4B 교사 30.6%, 235B 교사 50.6%까지 노이즈(정답에 벌점, 오답에 점수)였는데, 노이즈를 지우고 학습해도 결과가 사실상 같았다.
  • OPD의 이득은 저확률 토큰에 집중되며, 고정된 음의 어드밴티지 하나로 교사 신호를 대체할 수 있음을 보였다.
  • 외부 감독이 전혀 없는 OPSA는 AIME24 Avg@32를 +35.41점(상대 263%) 올렸고 OPD보다 16.77점 높았다.
  • 3개 수학 벤치마크(AIME24/25, HMMT) 모두에서 Pass@32를 두 배 이상 늘렸다.
  • 확률이 갈리는 고엔트로피 분기점에서는 후보 토큰에 확률을 골고루 나눠, 분포를 날카롭게 만들면서도 탐색 다양성을 유지했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)