Weak-to-Strong Generalization via Direct On-Policy Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 577
- 분야
- Machine Learning
- arXiv 번호
- 2607.05394
Direct-OPD는 소형 모델의 RL 학습 결과를 정책 변화량으로 추출하여 대형 모델에 전달하는 weak-to-strong 학습법이다.
Direct-OPD는 RL로 학습된 약한 모델의 정책 변화(policy shift)를 pre-RL 참조 모델과의 log-ratio로 추출하여, 이를 더 강한 학생 모델의 on-policy 상태에 적용하는 방법이다. 단순히 약한 모델을 모방하는 대신 RL이 만든 개선 신호만 전달한다. Qwen3-1.7B를 AIME 2024에서 48.3%에서 62.4%로 단 8개 A100 GPU로 4시간 만에 향상시켰으며, 이는 32개 A100으로 일주일 걸리는 직접 RL과 동등한 수준이다.
핵심 요약
- 핵심 아이디어: post-RL 약한 모델과 pre-RL 참조의 log-ratio가 KL-정규화 RL의 암묵적 보상과 동일
- 약한 모델(1.5B)의 RL 결과를 Qwen3-1.7B/4B, R1-Distill-7B 등 더 강한 모델에 전달하여 모두 성능 향상
- Qwen3-1.7B AIME 2024 정확도 48.3% → 62.4% (8×A100, 4시간), 직접 RL(Polaris, 32×A100, 1주일)과 동등
- 약한 모델의 최종 정책을 모방(일반 OPD)하면 강한 학생의 성능이 오히려 하락하는 것과 대조적
- 응답 길이와 KL 계수가 전이 신뢰성의 핵심 제어 변수이며, adaptive KL이 평균 보상을 안정화
- 여러 교사 쌍(R1-Distill→JustRL, Nemotron→QuestA)에서 일관된 향상 확인
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.