On-Policy Delta Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 651
- 분야
- Machine Learning
- arXiv 번호
- 2607.15161
선생 모델과 그 이전 모델의 '차이(델타)'를 증류 신호로 써서, 학생 모델의 추론 능력을 더 효과적으로 전달하는 새로운 증류 방법이다.
이 논문은 한마디로 선생 모델의 '학습 궤적'을 활용해 더 효과적으로 지식을 전달하는 증류 방법이다. 기존 온폴리시 증류는 선생 모델의 출력을 그대로 따라 하게 했지만, OPD2는 선생 모델이 추론 능력을 얻기 전후의 차이(델타 신호)를 핵심 학습 신호로 사용한다. 수학, 과학, 코드 세 영역 14개 벤치마크에서 일관되게 기존 방식을 뛰어넘었으며, Qwen3와 Gemma4 등 다양한 크기(1.7B~8B)에서 효과를 확인했다. 추가 계산 비용은 8~28% 수준으로 실용적이다.
핵심 요약
- 선생 모델의 최종 출력이 아니라 '학습 전후 차이'를 신호로 쓰면 추론 능력 전달이 더 정확해진다는 통찰을 제시했다.
- 수학, 과학, 코드 3개 영역 14개 벤치마크에서 일관되게 기존 온폴리시 증류를 능가했다.
- Qwen3(1.7B~8B)와 Gemma4 등 최신 모델에서 광범위하게 검증하여 신뢰성이 높다.
- 추가 계산 비용이 8~28%에 불과해, 기존 증류 파이프라인에 쉽게 적용할 수 있다.
- 델타 신호가 추론 관련 토큰('hence', 'however' 등)에 집중되는 반면, 탐색적 토큰('try', 'verify')은 억제한다는 분석을 제시했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.