Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients

발행일
출처
arXiv
논문 번호
451
분야
LLMs / NLP
arXiv 번호
2606.18216

소형 모델(0.8B-9B)에 교사 지식을 전달할 때 logit 모방이나 정책 그래디언트 주입 대신 프롬프트 내에 교사를 배치하는 ZPPO 방법이다. Qwen3.5 0.8B-9B에서 31개 벤치마크 검증 결과 기존 distillation 및 GRPO를 능가한다.

ZPPO(Zone of Proximal Policy Optimization)는 소형 학생 모델의 RL 후훈련에서 교사 지식을 프롬프트 안에만 두고 정책 그래디언트에서는 배제하는 방법이다. 어려운 문제에 대해 BCQ(정답/오답 후보 쌍)와 NCQ(학생 오답 집계)라는 두 가지 재구성된 프롬프트를 구성하고, prompt replay buffer로 순환시킨다. Qwen3.5 패밀리(0.8B-9B)를 27B 교사로 후훈련하여 31개 벤치마크(VLM 16, LLM 10, Video 5)에서 기존 distillation 및 GRPO를 일관되게 능가했으며, 가장 작은 0.8B에서 가장 큰 개선을 보였다.

핵심 요약

  • 교사 logit 모방의 mode-seeking bias와 교사 응답의 정책 그래디언트 주입 drift 문제를 동시에 해결
  • BCQ: 교사 정답과 학생 오답을 익명 후보로 배치하여 학생이 판별하도록 유도 (on-policy 유지)
  • NCQ: 학생의 실패한 rollout을 집계하여 공통 실패 패턴을 프롬프트로 제시
  • Prompt replay buffer로 hard question을 순환시켜 학생의 zone of proximal development 내에서 학습 증폭
  • 0.8B에서 GRPO 대비 VLM 평균 +4.9pp, LLM +4.4pp, Video +2.3pp 향상; 특히 GPQA-D에서 +16.9pp 큰 개선
  • 교사 크기가 클수록 ZPPO 이득이 커지며, 4B/9B 교사로는 이득이 축소됨을 확인

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)