Rethinking the Divergence Regularization in LLM RL

발행일
출처
arXiv
논문 번호
393
분야
Machine Learning
arXiv 번호
2606.09821

LLM RL에서 trust region 제어를 위해 DPPO의 hard mask를 smooth quadratic regularizer로 대체한 DRPO를 제안해 안정성과 효율성을 개선한다.

LLM 강화학습에서 PPO의 비율 클리핑은 장꼬리 어휘에서 분포 이동을 제대로 포착하지 못한다. DPPO는 이를 발산 기반 마스크로 해결하지만, 경계를 넘으면 기울기가 단절되는 문제가 있다. 이 논문은 DRPO(Divergence Regularized Policy Optimization)를 제안하여 hard mask를 이점 가중 적용된 매끄러운 이차 정규화항으로 대체한다. Binary-TV 기하학을 유지하면서도 경계 너머에서 교정 신호를 제공하며, Qwen3-4B/30B 등에서 GRPO, DPPO, SPO 대비 일관된 성능 향상을 보인다.

핵심 요약

  • DPPO의 hard mask를 advantage-weighted l2_2 정규화항으로 대체하여 매끄러운 기울기 보장
  • Binary-TV trust region 기하학 유지: 발산 기반의 안정성 + SPO류 매끄러움 결합
  • 경계 내에서는 정책 기울기 유지, 경계 너머에서는 교정적 기울기(정책을 행동 정책 방향으로 당김) 제공
  • Qwen3-4B, Qwen3-30B-A3B (MoE)에서 BF16/FP8 설정 교차 검증, GRPO/DPPO/SPO 대비 일관된 우위
  • 절대 어드밴티지 |A_t| 가중치가 trust region 경계를 보상 척도와 독립적으로 안정화함이 ablation으로 확인
  • KL/TV/chi2 등 다른 발산 정규화보다 DRPO가 우수하며, 이는 기울기 형태가 목적함수 형태보다 중요함을 시사

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)