AsyncOPD: How Stale Can On-Policy Distillation Be?

발행일
출처
arXiv
논문 번호
496
분야
Machine Learning
arXiv 번호
2606.24143

비동기 On-Policy Distillation에서 오래된 데이터 문제를 체계적으로 연구하고 AsyncOPD 파이프라인으로 1.6배~3.8배 학습 처리량 향상을 달성한다.

AsyncOPD는 비동기 On-Policy Distillation(OPD)에서 오래된 데이터(stale data) 문제를 체계적으로 연구한다. KL 방향이 stale 데이터 문제를 바꾼다는 것을 보이고(teacher-weighted forward KL는 robust, student-weighted reverse KL는 취약), reverse-KL OPD에서 학습 시점에 advantage를 재계산하는 것이 가장 효과적임을 보인다. 오래된 sparse top-k는 지원 불일치 문제가 있고 one-sample MC는 correctable하지만 높은 분산을 가지므로 multi-sample MC를 제안한다. AsyncOPD 파이프라인은 Qwen3-Base 모델에서 1.6배~3.8배 학습 처리량 향상을 달성하면서 비슷한 정확도를 유지한다.

핵심 요약

  • AsyncOPD는 비동기 On-Policy Distillation(OPD)에서 오래된 데이터(stale data) 문제를 체계적으로 연구한다
  • KL 방향이 stale 데이터 문제를 바꾼다는 것을 보이고(teacher-weighted forward KL는 robust, student-weighted reverse KL는 취약), reverse-KL OPD에서 학습 시점에 advantage를 재계산하는 것이 가장 효과적임을 보인다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)