OPRD: On-Policy Representation Distillation

발행일
출처
arXiv
논문 번호
350
분야
Machine Learning
arXiv 번호
2606.06021

온-정책 증류를 출력 공간에서 hidden-state 공간으로 끌어올려 학생-교사 격차를 완전히 해소하는 OPRD(On-Policy Representation Distillation)를 제안한다.

기존 온-정책 증류(OPD)는 출력 분포만 매칭하여 대어휘 샘플링 분산과 LM-head 정보 병목이라는 두 가지 근본적 한계가 있었다. OPRD는 교사의 중간 hidden state를 정렬 대상으로 삼아 분산을 제거하고, 층별·위치별 구조적 정보를 결정론적으로 전달한다. 수학 추론 벤치마크(AIME 2024/2025, AIMO)에서 학생-교사 격차를 완전히 해소했으며, top-k OPD 대비 1.44배 빠른 학습과 최대 54% 적은 GPU 메모리를 달성했다.

핵심 요약

  • 출력 공간 매칭에서 hidden-state 공간 매칭으로 증류를 상향 — 기존 모든 OPD 변종의 구조적 한계를 극복
  • Qwen ~150K 어휘처럼 대어휘 모델에서 Monte Carlo KL 추정의 분산 문제를 결정론적 MSE로 제거
  • LM-head 투영이 폐기하던 교사의 층별·위치별 중간 표현을 직접 학생에 전달
  • AIME 2024/2025, AIMO 세 경쟁 수학 벤치마크에서 학생-교사 격차 완전 해소
  • 동일 하드웨어에서 top-k OPD 대비 1.44× 빠른 학습, 최대 54% 적은 actor-update 메모리
  • 다중 모델 RL 병합, 온-정책 자기 증류(OPSD) 등 확장 시나리오에서 메모리·분산 이점이 특히 큼

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)