OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation
- 발행일
- 출처
- arXiv
- 논문 번호
- 349
- 분야
- Machine Learning
- arXiv 번호
- 2606.06096
평균 보상이 아닌 순서 통계량(VaR, CVaR, trimmed mean, top-m 등) 목표함수를 최적화하는 OrderGrad를 제안하여, 기존 정책 경사에 단순한 보상 변환만으로 적용할 수 있다.
OrderGrad는 순서 통계량 기반 목표함수를 위한 불편 그래디언트 추정기 제품군으로, 정렬된 보상에 가중치를 부여하는 L-통계량을 최적화한다. 순위 가중치를 변경하는 것만으로 VaR, CVaR, trimmed mean, 중앙값, top-m/best-of-K 등 다양한 분포적 목표를 표현할 수 있으며, 기존 likelihood-ratio 및 reparameterization 그래디언트에 보상-변환 형태로 간단히 적용된다. 실험에서 Top-M@K 목표함수로 LLM 수학 사후 학습을 수행한 결과, MaxPO(max@K 특수사례) 대비 pass@1을 5.7% 향상시키고 pass@256을 2.6% 향상시켰다. 또한 Top-M에 정답 보상, Bottom-M에 길이 페널티를 결합하는 다중 보상 설정에서 GRPO의 스칼라화 방식이 붕괴하는 것과 달리 정답률을 유지하면서 응답 길이를 크게 단축했다.
핵심 요약
- 순서 통계량(L-통계량) 기반 목표함수에 대한 불편 그래디언트 추정기를 제안하며, 순위 가중치 변경만으로 다양한 분포적 목표(VaR, CVaR, trimmed mean, best-of-K 등)를 표현한다.
- 기존 likelihood-ratio 및 reparameterization 업데이트에 보상 변환 형태로 한 줄 코드로 적용 가능한 plug-and-play 설계다.
- Top-M@K가 기존 Max@K(max@K, m=1 특수사례)보다 pass@1 및 pass@256에서 일관된 향상을 보여준다.
- Top-M에 정답 보상, Bottom-M에 길이 페널티를 결합하는 방식이 GRPO의 단순 스칼라화보다 훨씬 효과적으로 응답 길이를 단축한다.
- K(목표 크기)와 m(상위 랭크 수)의 선택이 탐색-활용 trade-off를 조절하며, K가 클수록 pass@256이 향상되고 pass@1은 감소하는 경향을 보인다.
- O(N log N) 정렬 비용으로 사실상 무시할 수 있는 오버헤드를 가진다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.