RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation

발행일
출처
arXiv
논문 번호
397
분야
Machine Learning
arXiv 번호
2606.11709

온정책 자기증류(OPSD)의 스타일 드리프트 문제를 대조 학습으로 해결한 RL 방법. Qwen3 1.7B/4B/8B에서 GRPO 및 기존 OPSD 대비 일관된 성능 향상.

온정책 자기증류(OPSD)는 정답 힌트로 조건부 부여 시 모델의 스타일 토큰에 학습 신호가 집중되는 privilege-induced style drift 문제를 발견했다. RLCSD는 정답 힌트와 오답 힌트를 대조하여 스타일 성분을 상쇄하고 태스크 관련 토큰에 신호를 집중시킨다. GRPO의 advantage를 token-level에서 변조하는 방식으로 통합되며, Qwen3 전 규모와 Olmo-3에서 GRPO 및 기존 OPSD 방법들을 일관되게 능가한다.

핵심 요약

  • 특권 조건부가 스타일 토큰("Therefore", "Wait" 등)에 학습 신호를 집중시키는 privilege-induced style drift 현상 발견
  • 정답/오답 힌트 대조를 통해 스타일 성분 상쇄, 태스크 토큰(수학적 내용 등)에 신호 집중
  • Qwen3-8B에서 AMC23 90.8%, AIME24 77.5%, AIME25 69.7%로 GRPO 및 OPSD 계열 대비 우수
  • 기존 OPSD 방법(OPSD, SDPO, SRPO, RLSD)의 훈련 불안정성 및 응답 길이 수축 문제 해결
  • 대조 원리는 범용적: 기존 OPSD 방법에 플러그인으로 적용 가능, cross-model 증류로 확장 가능
  • K-marginalization과 two-path loss aggregation이 성능 유지에 핵심 기여

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)