OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation

발행일
출처
arXiv
논문 번호
349
분야
Machine Learning
arXiv 번호
2606.06096

평균 보상이 아닌 순서 통계량(VaR, CVaR, trimmed mean, top-m 등) 목표함수를 최적화하는 OrderGrad를 제안하여, 기존 정책 경사에 단순한 보상 변환만으로 적용할 수 있다.

OrderGrad는 순서 통계량 기반 목표함수를 위한 불편 그래디언트 추정기 제품군으로, 정렬된 보상에 가중치를 부여하는 L-통계량을 최적화한다. 순위 가중치를 변경하는 것만으로 VaR, CVaR, trimmed mean, 중앙값, top-m/best-of-K 등 다양한 분포적 목표를 표현할 수 있으며, 기존 likelihood-ratio 및 reparameterization 그래디언트에 보상-변환 형태로 간단히 적용된다. 실험에서 Top-M@K 목표함수로 LLM 수학 사후 학습을 수행한 결과, MaxPO(max@K 특수사례) 대비 pass@1을 5.7% 향상시키고 pass@256을 2.6% 향상시켰다. 또한 Top-M에 정답 보상, Bottom-M에 길이 페널티를 결합하는 다중 보상 설정에서 GRPO의 스칼라화 방식이 붕괴하는 것과 달리 정답률을 유지하면서 응답 길이를 크게 단축했다.

핵심 요약

  • 순서 통계량(L-통계량) 기반 목표함수에 대한 불편 그래디언트 추정기를 제안하며, 순위 가중치 변경만으로 다양한 분포적 목표(VaR, CVaR, trimmed mean, best-of-K 등)를 표현한다.
  • 기존 likelihood-ratio 및 reparameterization 업데이트에 보상 변환 형태로 한 줄 코드로 적용 가능한 plug-and-play 설계다.
  • Top-M@K가 기존 Max@K(max@K, m=1 특수사례)보다 pass@1 및 pass@256에서 일관된 향상을 보여준다.
  • Top-M에 정답 보상, Bottom-M에 길이 페널티를 결합하는 방식이 GRPO의 단순 스칼라화보다 훨씬 효과적으로 응답 길이를 단축한다.
  • K(목표 크기)와 m(상위 랭크 수)의 선택이 탐색-활용 trade-off를 조절하며, K가 클수록 pass@256이 향상되고 pass@1은 감소하는 경향을 보인다.
  • O(N log N) 정렬 비용으로 사실상 무시할 수 있는 오버헤드를 가진다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)