Weak-to-Strong On-Policy Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 761
- 분야
- Machine Learning
- arXiv 번호
- 2607.26246
더 약한 모델들로부터 강한 학생 모델을 개선하는 온폴리시 증류 프레임워크로, 교사 모델을 능가하는 성능 달성.
이 논문은 한마디로 '약한 모델들이 강한 모델을 가르칠 수 있다'는 것을 보인 연구다. 기존 지식 증류는 더 크고 강한 교사에서 학생으로 지식을 전달했지만, 이 연구는 반대로 약한 모델 쌍의 차이(logit 차이)에서 '능력 방향'을 추출해 강한 학생에 주입한다. 수학·코딩 벤치마크에서 기존 온폴리시 증류를 뛰어넘었고, 심지어 약한 교사 모델 자체도 넘어섰다.
핵심 요약
- 약한 모델 쌍(양성/음성)의 logit 차이에서 능력 방향을 분리해 강한 학생에게 더하는 새로운 증류 방식을 제안했다.
- 세 가지 구성을 제안: RL 전후 모델 쌍, 크기 다른 기본 모델 쌍, 정답/오답 힌트 쌍.
- 수학 4개·코딩 3개 벤치마크에서 기존 OPD 대비 수학 +11.4%, 코딩 +12.0% 상대 향상을 달성했다.
- 약한 모델에서만 배웠음에도 실제 약한 교사 모델 자체를 능가하는 결과를 보였다.
- RL 대비 모델은 '추론 뼈대'를, 크기 대비 모델은 '풀이 절차'를 강화하는 보완적 신호를 제공함을 발견했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.