VIMPO: Value-Implicit Policy Optimization for LLMs

발행일
출처
arXiv
논문 번호
463
분야
Machine Learning
arXiv 번호
2606.20008

GRPO의 토큰 수준 신용 할당 한계를 KL-정규화 RL의 최적조건에서 유도한 policy-implied value function으로 해결하는 critic-free 강화학습 방법.

VIMPO는 KL-정규화 강화학습의 최적조건에서 policy log-ratio로 value function을 암시적으로 유도하여, critic 없이도 토큰 수준 신용 할당을 제공하는 정책 최적화 방법이다. 자기회귀 생성을 deterministic-transition MDP로 모델링하고, 종단 조건 V(s_T)=0을 활용해 critic-free Bellman 일관성 목표를 도출한다. MATH-500, AIME 2024/2025, OlympiadBench에서 GRPO를 일관되게 능가하며, 특히 노이즈 보상 환경에서 더 강건한 성능을 보인다.

핵심 요약

  • KL-정규화 RL 최적조건에서 value function을 policy-reference log-ratio로 표현하는 폐쇄형 표현 도출 (critic 불필요)
  • 종단 경계조건 V*(s_T)=0 + Monte Carlo 그룹 추정으로 critic-free value optimization 목표 구성
  • 동일 도출에서 PPO 스타일 actor advantage를 얻어, reward 주입(value loss)과 정책 개선(actor update)을 분리
  • MATH-500, AIME 2024, AIME 2025, OlympiadBench에서 GRPO 대비 일관된 성능 향상, 특히 경시대회형 문제에서 큰 폭 개선
  • 25% 보상 뒤집기 노이즈 환경에서도 GRPO 대비 일관된 우위 유지, 보상 노이즈에 더 강건
  • 4B 규모 base 모델로 수학 RLVR에 검증, actor coefficient c_A와 value coefficient β의 조정이 학습 속도-안정성 트레이드오프를 결정

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)