On-Policy Self-Distillation without Any Supervision

발행일
출처
arXiv
논문 번호
842
분야
Machine Learning
arXiv 번호
2608.06296

외부 감독 없이 모델 자신의 다수결 투표로 의사 해답을 만들어 자기 증류하는 무감독 강화학습 방법을 제안했다.

이 논문은 한마디로 정답 라벨이 없어도 모델이 스스로 여러 번 풀어서 다수결로 가짜 정답을 만들고, 그것으로 자기를 교정하는 방법이다. U-OPSD는 여러 롤아웃을 샘플링하고, 다수결로 의사 해답을 만들어 교사로 쓰고, 틀린 롤아웃을 학생으로 증류한다. Qwen3 4B/8B에서 기존 OPSD(정답 사용)와 동급이거나 더 좋았다.

핵심 요약

  • 외부 정답·환경 피드백·대형 모델 없이 모델 자체 생성만으로 자기 증류를 달성했다.
  • 다수결 투표로 의사 해답을 만들고, 가장 짧은 동의 롤아웃을 교사로 사용한다.
  • 틀린 롤아웃의 접두사에 증류를 적용해 모델이 틀린 부분을 정확히 교정한다.
  • 수학 벤치마크에서 비사고 모드 기준 base 대비 +8.5~10.7%p, OPSD 대비 +3.2~2.3%p 개선.
  • 순방향 KL이 가장 효과적이고, 역방향 KL은 학습이 발산하며 JSD는 효과가 없다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)