Purified OPSD: On-Policy Self-Distillation Without Losing How to Think
- 발행일
- 출처
- arXiv
- 논문 번호
- 556
- 분야
- AI / General
- arXiv 번호
- 2607.02234
Long-CoT 모델에서 OPSD가 실패하는 원인을 reference-induced shortcut으로 진단하고, PMI 기반 정제로 해결한다.
온폴리시 자기증류(OPSD)가 long-CoT 추론 모델에서 일관되게 실패하는 원인을 분석했다. 교사의 감독 신호를 분해하여, reference 해답에 의한 비전이 가능 성분이 전체 업데이트를 지배한다는 것을 발견했다. 이를 해결하기 위해 reference-only teacher로 비전이 성분을 분리하고, PMI(pointwise mutual information)로 잔차를 정제된 타겟 분포로 변환하는 방법을 제안한다. 4개 long-CoT 모델에서 일관된 개선을 달성하면서 모델의 자연스러운 인지적 추론 능력을 보존했다.
핵심 요약
- OPSD가 Qwen3-8B, Qwen3-4B, R1-Distill-7B, OLMo-7B 4개 long-CoT 모델에서 일관되게 실패
- 교사 신호 분해: reference-induced 성분이 업데이트 방향·크기 모두를 지배, question-conditioned 성분은 직교 또는 반대
- epistemic marker('Wait','Maybe' 등)가 OPSD 훈련 중 폭발 또는 붕괴→반성적 추론 능력 손상
- PMI 타겟 분포: log πT - log πref로 비전이 성분 제거, β와 c 파라미터에 강건
- AIME 2024/2025에서 OPSD-Standard 대비 일관된 성능 향상, base model도 능가
- 소프트 클리핑 임계값 c∈{5,10,20}과 보정 강도 β∈{0.5,1,2} 모두에서 안정적 개선
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.