What Does Privileged Information Add to On-Policy Self-Distillation?

발행일
출처
arXiv
논문 번호
1097
분야
LLMs / NLP
arXiv 번호
2609.20612

온폴리시 자기증류(OPSD)에서 정답을 아는 교사가 주는 추가 정보의 효과를, 정답은 같고 설명 수준만 다른 6가지 버전으로 통제 비교해 분석한 논문이다.

이 논문은 한마디로 온폴리시 자기증류(모델이 자기 복제본 교사에게 배우는 학습법)에서 '교사에게 정답을 보여주는 특권 정보'가 실제로 얼마나 더 도움이 되는지 분리해서 측정한 연구다. 수학 문제 5,319개에 정답은 같고 설명 수준만 다른 6가지 보기(정답만, 요점, 완전 풀이 등)를 갖춘 AMPLE-MATH 데이터셋을 만들고, 각 보기를 정답 없는 기본 증류와 비교했다. 결과는 Qwen3-1.7B에서는 정답 없이도 개선의 대부분이 이미 나타났고, 정답 정보의 추가 이득은 미미했으며 SmolLM3-3B에서만 완전 풀이가 약 2%포인트 더 도왔다. 특히 학생 모델의 롤아웃(연습 답안 생성 방식)을 짧은 직답에서 긴 사고형으로 바꾸자 같은 조건에서 이득이 손실로 뒤집혔다.

핵심 요약

  • 정답은 같고 설명 수준만 다른 6가지 보기를 가진 5,319문제 수학 데이터셋(AMPLE-MATH)을 만들어, 특권 정보의 효과만 분리해 측정할 수 있게 했다.
  • Qwen3-1.7B에서는 정답 정보 없이도 증류 효과의 대부분이 나타났고, 추가 이득은 다듬어진 풀이를 줬을 때 가장 컸다(그래도 미미한 수준).
  • SmolLM3-3B에서는 완전 풀이 트레이스가 50스텝 시점에서 약 2%포인트의 추가 이득을 보였다.
  • 문제·정답·평가를 그대로 두고 학생의 답안 생성 방식만 직답에서 긴 사고형으로 바꾸자 두 모델 모두 이득이 손실로 뒤집혔다.
  • 교사의 토큰 수준 감독 신호를 바꿔도 학생 행동은 거의 그대로인 경우가 많았고, 손실 창을 넓힌 이득의 76%는 사실 조기 스톱 시점 차이였다.
  • 결론적으로 OPSD는 기존 추론 능력에 대한 접근성을 높이는 효과가 크고, 특권 정보의 가치는 풀이를 얼마나 드러내느냐가 아니라 이 전이에 얼마나 보태느냐로 판단해야 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)