GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
- 발행일
- 출처
- arXiv
- 논문 번호
- 102
- 분야
- RL / Training
- arXiv 번호
- 2601.05242
GDPO(Group reward-Decoupled Normalization Policy Optimization)는 기존 GRPO 방법에 내재된 '보상 신호 붕괴'를 해결하여, 대규모 언어 모델 정렬을 위한 다중 보상 강화학습을 개선한다.
GDPO(Group reward-Decoupled Normalization Policy Optimization)는 기존 GRPO 방법에 내재된 '보상 신호 붕괴'를 해결하여, 대규모 언어 모델 정렬을 위한 다중 보상 강화학습을 개선한다. 이를 위해 개별 보상 구성요소의 정규화를 분리하여 더 안정적인 학습과 향상된 성능을 달성하며, 예를 들어 AIME에서 수학적 추론 정확도를 최대 6.3% 높인다.
핵심 요약
- 대규모 언어 모델(LLM)을 다양한 인간 선호도(예: 안전성, 일관성, 효율성)에 정렬하려면 다중 보상 강화학습이 필요하다.
- 흔히 사용되는 Group Relative Policy Optimization(GRPO) 알고리즘은 여러 보상의 합에 적용될 때 '보상 신호 붕괴'를 겪는데, 이는 서로 다른 보상 조합이 동일한 어드밴티지 값을 산출할 수 있음을 의미한다.
- 이러한 보상 신호 붕괴는 학습 신호의 해상도를 떨어뜨려, 최적 이하의 수렴, 학습 안정성 저하, 잠재적인 조기 학습 실패로 이어진다.
- GDPO는 개별 보상 구성요소의 정규화를 분리하여, 각 보상에 대해 그룹 단위 정규화를 별도로 수행함으로써 세밀한 구분을 보존한다.
- 개별적으로 정규화한 어드밴티지는 이후 합산되며, 정책 업데이트의 수치적 안정성을 보장하기 위해 추가적인 배치 단위 정규화를 거친다.
- 보상 간 우선순위를 관리하기 위해, GDPO는 보상 가중치를 탐색하고 보상 함수 조건화를 제안하는데, 이는 더 어려운 목표가 달성된 경우에만 더 쉬운 보상을 부여하는 방식이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.