Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 952
- 분야
- Machine Learning
- arXiv 번호
- 2608.19098
여러 분야 전문가 모델(수학·코딩·지시수행)을 한 학생 모델로 합치는 멀티티처 온폴리시 증류에서 '왜 능력이 새는가'를 진단하고, 토큰 예산 재분배로 복구율을 35.6%에서 83.4%로 끌어올린 논문이다.
이 논문은 한마디로 '여러 전문가 선생 모델을 한 학생 모델로 통합하는 증류(지식 전수)가 왜 실패하는지'를 파헤치고 고친 연구다. RL로 학습된 수학·코딩·지시수행 전문 선생 3개의 능력을 3B 학생 모델에 옮기는 통제 실험 테드베드를 만들어보니, 표준 멀티티처 증류는 전문가를 각각 따로 증류한 것 대비 개선분의 35.6%만 회복했다. 원인은 선생 간 의견 충돌이 아니라 토큰 단위 최적화 예산의 잘못된 배분이었다. 짧은 답변을 내는 지시수행 과제는 프롬프트의 20.3%를 차지하는데도 그래디언트 토큰의 0.99%만 받는 식으로 구조적으로 굶었다. 토큰 몫 균형화, 격차 기반 동적 배분, 학생 보상 갱신 3가지를 조합한 Open-MOPD는 회복율을 83.4%로 올렸다. 전 과정을 8×A100 학술 예산으로 재현 가능하게 공개했다.
핵심 요약
- 정답 도메인 라벨로 완벽한 라우팅(선생 지정)을 줘도 통합은 실패한다. 병목은 라우팅이 아니라 능력 통합 자체였다.
- 범인은 선생 간 불일치가 아니라 토큰 예산 왜곡이었다. 지시수행은 입력 프롬프트의 20.3%를 차지하지만 그래디언트 토큰은 0.99%만 받았다.
- 왜곡 원인을 3가지로 분리했다. 도메인별 답변 길이 차이, 도메인별 수렴 속도 차이, 롤아웃 재사용으로 인한 학생 보상 신호의 부패.
- 토큰 몫 균형화 + 격차 인지 동적 배분 + 학생 보상 갱신을 더하니 개선분 회복율이 35.6%에서 83.4%로 올랐다.
- 전체 레시피·학습 궤적·평가 스위트를 8×A100-80GB 학술 예산으로 재현 가능하게 전부 공개했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.