Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training

발행일
출처
arXiv
논문 번호
555
분야
Machine Learning
arXiv 번호
2607.01763

온폴리시 자기증류(SDPO)가 연속 학습에서 망각과 붕괴를 유발함을 체계적으로 입증. GRPO가 더 안정적이다.

온폴리시 자기증류(SDPO)가 연속 포스트트레이닝에서 어떻게 작동하는지 체계적으로 분석했다. SDPO는 도메인 내 특화에서는 효과적이지만, 연속 학습 설정에서는 GRPO 대비 더 심각한 망각과 붕괴를 보인다. 핵심 원인은 밀집 토큰 수준 감독이 파라미터와 응답 공간에서 더 큰 드리프트를 유발하고, 포맷팅 아티팩트를 자기 증폭한다는 것이다. on-policy 데이터 자체로는 망각 완화가 부족하다는 결론을 도출한다.

핵심 요약

  • SDPO는 단일 도메인 특화에는 효과적이지만 OOD 일반화와 연속 학습에서는 취약
  • GRPO 대비 SDPO가 파라미터 드리프트(NSS, Principal Angle)와 응답 임베딩 변화 모두에서 더 큰 변화
  • SDPO 5%에서 '\boxed' 토큰 무한 반복 붕괴 발생→토큰 수준 감독의 아티팩트 증폭 메커니즘
  • Theorem 1: SDPO의 KL 드리프트가 GRPO의 KL-minimal Razor 정책보다 항상 크거나 같음을 증명
  • 핵심 교훈: on-policy 데이터 ≠ 망각 완화, 목적함수의 밀집도가 안정성을 결정
  • 데이터 순서 변경이나 토큰 마스킹으로 붕괴가 부분적으로만 완화→근본적 한계 존재

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)