A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions
- 발행일
- 출처
- arXiv
- 논문 번호
- 435
- 분야
- AI / General
- arXiv 번호
- 2606.16733
LLM policy optimization을 J(θ)의 두 축(trajectory side, reward side)에서 체계적으로 정리한 survey 논문이다. REINFORCE부터 GRPO, Agentic RL, OPD까지 단일 프레임워크로 진단적 분석을 제공한다.
모든 policy gradient 알고리즘이 J(θ) = E[R(τ)]의 두 factor인 trajectory probability와 reward를 어떻게 수정하는지를 기준으로 방법론을 분류한다. Trajectory side(collection, clipping, compression, diversity, repair)와 reward side(density, source, shaping, credit assignment)의 이축 진단 map을 제공한다. Post-GRPO 변형, Agentic RL, GRPO-OPD hybrid까지 동일한 축을 적용하여 결합 실패(coupled failure) 지점을 식별한다.
핵심 요약
- J(θ) = E[R(τ)]의 trajectory side와 reward side 두 축으로 모든 policy gradient 방법을 통일 분류
- REINFORCE → PPO → GRPO → post-GRPO 변형의 발전 과정을 각 단계의 failure mode와 intervention으로 설명
- Agentic RL(multi-turn)과 GRPO-OPD hybrid까지 동일한 두 축을 확장하여 적용
- 단일 축 수정으로 해결 불가능한 coupled failure 식별 및 차세대 알고리즘 설계 방향 제시
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.