RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 397
- 분야
- Machine Learning
- arXiv 번호
- 2606.11709
온정책 자기증류(OPSD)의 스타일 드리프트 문제를 대조 학습으로 해결한 RL 방법. Qwen3 1.7B/4B/8B에서 GRPO 및 기존 OPSD 대비 일관된 성능 향상.
온정책 자기증류(OPSD)는 정답 힌트로 조건부 부여 시 모델의 스타일 토큰에 학습 신호가 집중되는 privilege-induced style drift 문제를 발견했다. RLCSD는 정답 힌트와 오답 힌트를 대조하여 스타일 성분을 상쇄하고 태스크 관련 토큰에 신호를 집중시킨다. GRPO의 advantage를 token-level에서 변조하는 방식으로 통합되며, Qwen3 전 규모와 Olmo-3에서 GRPO 및 기존 OPSD 방법들을 일관되게 능가한다.
핵심 요약
- 특권 조건부가 스타일 토큰("Therefore", "Wait" 등)에 학습 신호를 집중시키는 privilege-induced style drift 현상 발견
- 정답/오답 힌트 대조를 통해 스타일 성분 상쇄, 태스크 토큰(수학적 내용 등)에 신호 집중
- Qwen3-8B에서 AMC23 90.8%, AIME24 77.5%, AIME25 69.7%로 GRPO 및 OPSD 계열 대비 우수
- 기존 OPSD 방법(OPSD, SDPO, SRPO, RLSD)의 훈련 불안정성 및 응답 길이 수축 문제 해결
- 대조 원리는 범용적: 기존 OPSD 방법에 플러그인으로 적용 가능, cross-model 증류로 확장 가능
- K-marginalization과 two-path loss aggregation이 성능 유지에 핵심 기여
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.