Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

발행일
출처
arXiv
논문 번호
556
분야
AI / General
arXiv 번호
2607.02234

Long-CoT 모델에서 OPSD가 실패하는 원인을 reference-induced shortcut으로 진단하고, PMI 기반 정제로 해결한다.

온폴리시 자기증류(OPSD)가 long-CoT 추론 모델에서 일관되게 실패하는 원인을 분석했다. 교사의 감독 신호를 분해하여, reference 해답에 의한 비전이 가능 성분이 전체 업데이트를 지배한다는 것을 발견했다. 이를 해결하기 위해 reference-only teacher로 비전이 성분을 분리하고, PMI(pointwise mutual information)로 잔차를 정제된 타겟 분포로 변환하는 방법을 제안한다. 4개 long-CoT 모델에서 일관된 개선을 달성하면서 모델의 자연스러운 인지적 추론 능력을 보존했다.

핵심 요약

  • OPSD가 Qwen3-8B, Qwen3-4B, R1-Distill-7B, OLMo-7B 4개 long-CoT 모델에서 일관되게 실패
  • 교사 신호 분해: reference-induced 성분이 업데이트 방향·크기 모두를 지배, question-conditioned 성분은 직교 또는 반대
  • epistemic marker('Wait','Maybe' 등)가 OPSD 훈련 중 폭발 또는 붕괴→반성적 추론 능력 손상
  • PMI 타겟 분포: log πT - log πref로 비전이 성분 제거, β와 c 파라미터에 강건
  • AIME 2024/2025에서 OPSD-Standard 대비 일관된 성능 향상, base model도 능가
  • 소프트 클리핑 임계값 c∈{5,10,20}과 보정 강도 β∈{0.5,1,2} 모두에서 안정적 개선

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)