On Advantage Estimates for Max@K Policy Gradients

발행일
출처
arXiv
논문 번호
346
분야
Machine Learning
arXiv 번호
2606.06080

max@K 정책 경사 추정에서 advantage를 정확히 중심화(centering)하는 Leave-Two-Out 베이스라인을 도입한 MaxPO를 제안하여, 기존 비중심화 방법 대비 그래디언트 분산을 크게 줄인다.

이 논문은 LLM 사후 학습에 널리 사용되는 pass@K 및 max@K 정책 최적화에서 advantage 추정의 품질을 개선한다. 기존 선도 방법인 PKPO의 advantage 추정기가 정책 경사에서는 불편이지만 중심화되지 않아 불필요한 분산이 남는 문제를 지적하고, Leave-Two-Out(L2O) 베이스라인을 도입하여 불편성을 유지하면서 실현 배치 advantage를 정확히 중심화하는 MaxPO를 제안한다. 또한 유한 배치 max@K에 대한 정준(canonical) advantage 형태를 유도하여 기존 추정기들을 비중심화·정준·정규화 정준의 세 클래스로 통일적으로 분류한다. Llama-3.2-3B-Instruct에서 PKPO 대비 77.4%의 그래디언트 분산 감소를 달성하고, Qwen2.5-Math-7B에서는 5개 수학 추론 벤치마크 평균 pass@256을 5.2% 향상시켰다.

핵심 요약

  • 기존 PKPO의 advantage 추정기가 정책 경사에서는 불편이지만 중심화되지 않음을 수학적으로 증명하고, Leave-Two-Out(L2O) 베이스라인으로 이를 해결한다.
  • 유한 배치 max@K에 대한 정준(canonical) advantage ui-vi를 유도하여, 기존 pass@K/max@K 추정기를 통일된 프레임워크에서 분류한다.
  • O(B^2) 시간 복잡도의 벡터화 구현으로 효율적이며, 그룹 기반 RL 파이프라인에 자연스럽게 통합된다.
  • Llama-3.2-3B-Instruct에서 그래디언트 분산을 PKPO 대비 77.4% 감소시키고, Qwen2.5-Math-7B에서 pass@256을 5.2% 향상시킨다.
  • GRPO, Entropy-Adv 등 강력한 LLM 사후 학습 베이스라인 대비 일관된 성능 향상을 보여준다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)