MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
- 발행일
- 출처
- arXiv
- 논문 번호
- 528
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.30406
여러 도메인 RL 교사의 능력을 하나의 모델로 통합하는 Multi-teacher On-Policy Distillation(MOPD) 파이프라인을 제안한다. Qwen3-30B와 MiMo-V2-Flash에 적용.
MOPD는 여러 도메인별 RL 교사의 능력을 단일 학생 모델에 통합하는 post-training 패러다임이다. 3단계 파이프라인(일반 SFT → 도메인별 RL 교사 → 다중 교사 온정책 증류)을 통해 dense token-level 감독을 제공하며, 학생 자신의 rollout에서 훈련하여 exposure bias를 제거한다. Qwen3-30B-A3B에서 Mix-RL, Cascade RL, Off-Policy Finetune, Param-Merge를 모두 능가하며 정규화 점수 0.937을 달성했고, 산업 규모 모델 MiMo-V2-Flash에 배포되어 실용성을 검증했다.
핵심 요약
- 3단계 파이프라인: General SFT → Domain-specialised RL → Multi-teacher On-Policy Distillation
- 학생 rollout에서 per-token reverse KL로 교사-학생 정렬 → dense supervision + on-policy
- Qwen3-30B-A3B에서 차상위 baseline 대비 +5.5점, 교사-학생 간극의 91~95% 해소
- 도메인 교사 훈련이 병렬 가능 → 개발 처리량 향상, 도메인 간 결합 해제
- 동일 기원(same-origin) 교사가 안정적 최적화에 핵심적 (외부 교사 사용 시 발산 위험)
- MiMo-V2-Flash 산업 모델에 배포 → 실제 프론티어 규모 효용 검증
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.