DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

발행일
출처
arXiv
논문 번호
250
분야
LLMs / NLP
arXiv 번호
2605.25604

동적 분산 적응 어드밴티지 최적화(DVAO)는 GRPO(Group Relative Policy Optimization) 프레임워크 내에서 다중 보상 강화학습을 위한 방법을 도입하며, 보상 분산에 기반하여 목적 가중치를 동적으로 조정함으로써 상충하는 목표 간의 우수한 트레이드오프를 달성한다.

DVAO는 여러 보상을 함께 최적화하는 GRPO에서 고정 가중치가 만드는 불안정성과 목표 간 고립 문제를 해결하려는 방법이다. 각 롤아웃 그룹에서 보상별 경험적 분산을 계산해 학습 신호가 강한 목표의 비중은 높이고 잡음이 큰 신호는 억제한다. 저자들은 이 조합의 어드밴티지 크기가 제한되어 안정적인 학습을 돕는다는 성질과 목표 사이의 적응형 정규화 효과를 이론적으로 제시했다. Qwen3와 Qwen2.5를 사용한 수학 추론 및 도구 사용 실험에서는 기준 방법보다 나은 다목적 파레토 경계와 안정성을 보였다. 다만 매우 작은 롤아웃 그룹에서는 분산 추정이 불안정할 수 있고, 실험이 주로 두 개 목표에 집중됐으며 보상 함수 자체의 품질에도 의존한다.

핵심 요약

  • 사용 편의성 측면에서, 알고리즘이 데이터에 기반하여 최적의 균형을 적응적으로 찾아내므로 실무자가 보상 가중치를 수동으로 조정할 필요를 줄여준다.
  • 안정성 측면에서, '크기 폭발'을 피하는 데 필요한 이론적 안정성을 추가하면서도 GRPO 프레임워크의 효율성을 보존한다.
  • 시너지 측면에서, 교차 목적 정규화를 통해 모델이 추론 정확도 같은 더 어렵고 중요한 목표를 희생하면서 단지 '가장 쉬운' 보상만 최적화하지 않도록 보장한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)