On-policy Distillation with Verifiable Reward

발행일
출처
arXiv
논문 번호
1009
분야
Machine Learning
arXiv 번호
2608.24696

이 논문은 온폴리시 증류의 토큰 단위 신호에 정답 여부를 반영한 ReLU 게이트를 씌워, 새 하이퍼파라미터 없이 증류와 검증 가능한 보상 학습을 하나로 합쳤다.

이 논문은 한마디로 '정답 여부에 맞게 증류 신호의 부호를 정리한 후학습 방법'이다. 검증 가능한 보상 학습은 과제 단위로만 점수를 줘서 신호가 성기고, 온폴리시 증류는 토큰마다 촘촘하지만 그 궤적이 정답인지는 따지지 않는다. 저자들은 표본 토큰 증류에 숨어 있는 보상을 궤적 정답 여부로 다시 쓴 뒤, 맞은 궤적의 토큰은 음수 보상을 받지 않고 틀린 궤적의 토큰은 양수 보상을 받지 않도록 ReLU 게이트를 걸었다. 덕분에 새 하이퍼파라미터가 하나도 늘지 않고, 증류가 GRPO 같은 정책 경사 알고리즘과 그대로 결합된다. 같은 구조와 다른 구조 두 증류 설정 모두에서 여섯 개 추론 벤치마크 평균이 기존 온폴리시 증류보다 높았다.

핵심 요약

  • 표본 토큰 증류의 숨은 보상을 궤적 정답 여부로 다시 쓰고, 맞은 궤적에는 음이 아닌 보상만, 틀린 궤적에는 양이 아닌 보상만 남기는 ReLU 게이트를 적용했다.
  • Qwen3-4B 같은 구조 설정에서 여섯 벤치마크 평균이 49.1로 기존 증류의 47.8을 넘었고, AIME24에서는 36.9로 교사 모델의 36.0보다도 높았다.
  • 게이트 방향을 반대로 뒤집은 대조 실험은 여섯 벤치마크 모두에서 기본 증류보다 낮아, 부호를 정답에 맞추는 것이 효과의 원인임을 보였다.
  • 하이퍼파라미터를 새로 늘리지 않고 GRPO 같은 기존 정책 경사 알고리즘에 그대로 얹을 수 있어, 이미 돌아가는 후학습 파이프라인에 적은 수정으로 넣을 수 있다.
  • 다만 학생 모델이 교사를 따라잡지는 못해 다른 구조 설정에서는 평균 22.8로 교사의 30.9에 크게 못 미쳤고, 실험도 Qwen3 계열 수학 추론 벤치마크에 한정됐다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)