Weak-to-Strong On-Policy Distillation

발행일
출처
arXiv
논문 번호
761
분야
Machine Learning
arXiv 번호
2607.26246

더 약한 모델들로부터 강한 학생 모델을 개선하는 온폴리시 증류 프레임워크로, 교사 모델을 능가하는 성능 달성.

이 논문은 한마디로 '약한 모델들이 강한 모델을 가르칠 수 있다'는 것을 보인 연구다. 기존 지식 증류는 더 크고 강한 교사에서 학생으로 지식을 전달했지만, 이 연구는 반대로 약한 모델 쌍의 차이(logit 차이)에서 '능력 방향'을 추출해 강한 학생에 주입한다. 수학·코딩 벤치마크에서 기존 온폴리시 증류를 뛰어넘었고, 심지어 약한 교사 모델 자체도 넘어섰다.

핵심 요약

  • 약한 모델 쌍(양성/음성)의 logit 차이에서 능력 방향을 분리해 강한 학생에게 더하는 새로운 증류 방식을 제안했다.
  • 세 가지 구성을 제안: RL 전후 모델 쌍, 크기 다른 기본 모델 쌍, 정답/오답 힌트 쌍.
  • 수학 4개·코딩 3개 벤치마크에서 기존 OPD 대비 수학 +11.4%, 코딩 +12.0% 상대 향상을 달성했다.
  • 약한 모델에서만 배웠음에도 실제 약한 교사 모델 자체를 능가하는 결과를 보였다.
  • RL 대비 모델은 '추론 뼈대'를, 크기 대비 모델은 '풀이 절차'를 강화하는 보완적 신호를 제공함을 발견했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)