VIMPO: Value-Implicit Policy Optimization for LLMs
- 발행일
- 출처
- arXiv
- 논문 번호
- 463
- 분야
- Machine Learning
- arXiv 번호
- 2606.20008
GRPO의 토큰 수준 신용 할당 한계를 KL-정규화 RL의 최적조건에서 유도한 policy-implied value function으로 해결하는 critic-free 강화학습 방법.
VIMPO는 KL-정규화 강화학습의 최적조건에서 policy log-ratio로 value function을 암시적으로 유도하여, critic 없이도 토큰 수준 신용 할당을 제공하는 정책 최적화 방법이다. 자기회귀 생성을 deterministic-transition MDP로 모델링하고, 종단 조건 V(s_T)=0을 활용해 critic-free Bellman 일관성 목표를 도출한다. MATH-500, AIME 2024/2025, OlympiadBench에서 GRPO를 일관되게 능가하며, 특히 노이즈 보상 환경에서 더 강건한 성능을 보인다.
핵심 요약
- KL-정규화 RL 최적조건에서 value function을 policy-reference log-ratio로 표현하는 폐쇄형 표현 도출 (critic 불필요)
- 종단 경계조건 V*(s_T)=0 + Monte Carlo 그룹 추정으로 critic-free value optimization 목표 구성
- 동일 도출에서 PPO 스타일 actor advantage를 얻어, reward 주입(value loss)과 정책 개선(actor update)을 분리
- MATH-500, AIME 2024, AIME 2025, OlympiadBench에서 GRPO 대비 일관된 성능 향상, 특히 경시대회형 문제에서 큰 폭 개선
- 25% 보상 뒤집기 노이즈 환경에서도 GRPO 대비 일관된 우위 유지, 보상 노이즈에 더 강건
- 4B 규모 base 모델로 수학 RLVR에 검증, actor coefficient c_A와 value coefficient β의 조정이 학습 속도-안정성 트레이드오프를 결정
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.