AsyncOPD: How Stale Can On-Policy Distillation Be?
- 발행일
- 출처
- arXiv
- 논문 번호
- 496
- 분야
- Machine Learning
- arXiv 번호
- 2606.24143
비동기 On-Policy Distillation에서 오래된 데이터 문제를 체계적으로 연구하고 AsyncOPD 파이프라인으로 1.6배~3.8배 학습 처리량 향상을 달성한다.
AsyncOPD는 비동기 On-Policy Distillation(OPD)에서 오래된 데이터(stale data) 문제를 체계적으로 연구한다. KL 방향이 stale 데이터 문제를 바꾼다는 것을 보이고(teacher-weighted forward KL는 robust, student-weighted reverse KL는 취약), reverse-KL OPD에서 학습 시점에 advantage를 재계산하는 것이 가장 효과적임을 보인다. 오래된 sparse top-k는 지원 불일치 문제가 있고 one-sample MC는 correctable하지만 높은 분산을 가지므로 multi-sample MC를 제안한다. AsyncOPD 파이프라인은 Qwen3-Base 모델에서 1.6배~3.8배 학습 처리량 향상을 달성하면서 비슷한 정확도를 유지한다.
핵심 요약
- AsyncOPD는 비동기 On-Policy Distillation(OPD)에서 오래된 데이터(stale data) 문제를 체계적으로 연구한다
- KL 방향이 stale 데이터 문제를 바꾼다는 것을 보이고(teacher-weighted forward KL는 robust, student-weighted reverse KL는 취약), reverse-KL OPD에서 학습 시점에 advantage를 재계산하는 것이 가장 효과적임을 보인다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.