Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients
- 발행일
- 출처
- arXiv
- 논문 번호
- 451
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.18216
소형 모델(0.8B-9B)에 교사 지식을 전달할 때 logit 모방이나 정책 그래디언트 주입 대신 프롬프트 내에 교사를 배치하는 ZPPO 방법이다. Qwen3.5 0.8B-9B에서 31개 벤치마크 검증 결과 기존 distillation 및 GRPO를 능가한다.
ZPPO(Zone of Proximal Policy Optimization)는 소형 학생 모델의 RL 후훈련에서 교사 지식을 프롬프트 안에만 두고 정책 그래디언트에서는 배제하는 방법이다. 어려운 문제에 대해 BCQ(정답/오답 후보 쌍)와 NCQ(학생 오답 집계)라는 두 가지 재구성된 프롬프트를 구성하고, prompt replay buffer로 순환시킨다. Qwen3.5 패밀리(0.8B-9B)를 27B 교사로 후훈련하여 31개 벤치마크(VLM 16, LLM 10, Video 5)에서 기존 distillation 및 GRPO를 일관되게 능가했으며, 가장 작은 0.8B에서 가장 큰 개선을 보였다.
핵심 요약
- 교사 logit 모방의 mode-seeking bias와 교사 응답의 정책 그래디언트 주입 drift 문제를 동시에 해결
- BCQ: 교사 정답과 학생 오답을 익명 후보로 배치하여 학생이 판별하도록 유도 (on-policy 유지)
- NCQ: 학생의 실패한 rollout을 집계하여 공통 실패 패턴을 프롬프트로 제시
- Prompt replay buffer로 hard question을 순환시켜 학생의 zone of proximal development 내에서 학습 증폭
- 0.8B에서 GRPO 대비 VLM 평균 +4.9pp, LLM +4.4pp, Video +2.3pp 향상; 특히 GPQA-D에서 +16.9pp 큰 개선
- 교사 크기가 클수록 ZPPO 이득이 커지며, 4B/9B 교사로는 이득이 축소됨을 확인
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.