MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

발행일
출처
arXiv
논문 번호
528
분야
LLMs / NLP
arXiv 번호
2606.30406

여러 도메인 RL 교사의 능력을 하나의 모델로 통합하는 Multi-teacher On-Policy Distillation(MOPD) 파이프라인을 제안한다. Qwen3-30B와 MiMo-V2-Flash에 적용.

MOPD는 여러 도메인별 RL 교사의 능력을 단일 학생 모델에 통합하는 post-training 패러다임이다. 3단계 파이프라인(일반 SFT → 도메인별 RL 교사 → 다중 교사 온정책 증류)을 통해 dense token-level 감독을 제공하며, 학생 자신의 rollout에서 훈련하여 exposure bias를 제거한다. Qwen3-30B-A3B에서 Mix-RL, Cascade RL, Off-Policy Finetune, Param-Merge를 모두 능가하며 정규화 점수 0.937을 달성했고, 산업 규모 모델 MiMo-V2-Flash에 배포되어 실용성을 검증했다.

핵심 요약

  • 3단계 파이프라인: General SFT → Domain-specialised RL → Multi-teacher On-Policy Distillation
  • 학생 rollout에서 per-token reverse KL로 교사-학생 정렬 → dense supervision + on-policy
  • Qwen3-30B-A3B에서 차상위 baseline 대비 +5.5점, 교사-학생 간극의 91~95% 해소
  • 도메인 교사 훈련이 병렬 가능 → 개발 처리량 향상, 도메인 간 결합 해제
  • 동일 기원(same-origin) 교사가 안정적 최적화에 핵심적 (외부 교사 사용 시 발산 위험)
  • MiMo-V2-Flash 산업 모델에 배포 → 실제 프론티어 규모 효용 검증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)