A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions

발행일
출처
arXiv
논문 번호
435
분야
AI / General
arXiv 번호
2606.16733

LLM policy optimization을 J(θ)의 두 축(trajectory side, reward side)에서 체계적으로 정리한 survey 논문이다. REINFORCE부터 GRPO, Agentic RL, OPD까지 단일 프레임워크로 진단적 분석을 제공한다.

모든 policy gradient 알고리즘이 J(θ) = E[R(τ)]의 두 factor인 trajectory probability와 reward를 어떻게 수정하는지를 기준으로 방법론을 분류한다. Trajectory side(collection, clipping, compression, diversity, repair)와 reward side(density, source, shaping, credit assignment)의 이축 진단 map을 제공한다. Post-GRPO 변형, Agentic RL, GRPO-OPD hybrid까지 동일한 축을 적용하여 결합 실패(coupled failure) 지점을 식별한다.

핵심 요약

  • J(θ) = E[R(τ)]의 trajectory side와 reward side 두 축으로 모든 policy gradient 방법을 통일 분류
  • REINFORCE → PPO → GRPO → post-GRPO 변형의 발전 과정을 각 단계의 failure mode와 intervention으로 설명
  • Agentic RL(multi-turn)과 GRPO-OPD hybrid까지 동일한 두 축을 확장하여 적용
  • 단일 축 수정으로 해결 불가능한 coupled failure 식별 및 차세대 알고리즘 설계 방향 제시

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)