On-Policy Self-Distillation without Any Supervision
- 발행일
- 출처
- arXiv
- 논문 번호
- 842
- 분야
- Machine Learning
- arXiv 번호
- 2608.06296
외부 감독 없이 모델 자신의 다수결 투표로 의사 해답을 만들어 자기 증류하는 무감독 강화학습 방법을 제안했다.
이 논문은 한마디로 정답 라벨이 없어도 모델이 스스로 여러 번 풀어서 다수결로 가짜 정답을 만들고, 그것으로 자기를 교정하는 방법이다. U-OPSD는 여러 롤아웃을 샘플링하고, 다수결로 의사 해답을 만들어 교사로 쓰고, 틀린 롤아웃을 학생으로 증류한다. Qwen3 4B/8B에서 기존 OPSD(정답 사용)와 동급이거나 더 좋았다.
핵심 요약
- 외부 정답·환경 피드백·대형 모델 없이 모델 자체 생성만으로 자기 증류를 달성했다.
- 다수결 투표로 의사 해답을 만들고, 가장 짧은 동의 롤아웃을 교사로 사용한다.
- 틀린 롤아웃의 접두사에 증류를 적용해 모델이 틀린 부분을 정확히 교정한다.
- 수학 벤치마크에서 비사고 모드 기준 base 대비 +8.5~10.7%p, OPSD 대비 +3.2~2.3%p 개선.
- 순방향 KL이 가장 효과적이고, 역방향 KL은 학습이 발산하며 JSD는 효과가 없다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.