Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO
- 발행일
- 출처
- arXiv
- 논문 번호
- 1042
- 분야
- Machine Learning
- arXiv 번호
- 2608.27351
진화 전략(ES)이 GRPO보다 메모리 효율만 좋은 게 아니라, 답 다양성을 지키며 Pass@K까지 높이는 별개의 추론 학습 패러다임임을 보인 분석 논문.
이 논문은 한마디로 진화 전략(Evolution Strategies, ES)이 LLM 추론 학습에서 GRPO와 어떻게 다른지 파헤친 분석 논문이다. ES는 역전파 없이 파라미터를 무작위로 흔들어 보고 좋았던 방향으로 업데이트하는 방식이라 메모리를 적게 쓴다. 연구진은 ES가 GRPO처럼 탐색이 한쪽으로 쏠리는 엔트로피 붕괴 없이 Pass@1과 Pass@K를 동시에 높인다는 걸 이론·실험으로 보였다. 또 파라미터가 크게 움직여도 재앙적 망각이 필수는 아니며, 모델이 클수록 적은 개체수로도 학습이 된다는 실용 지침도 얻었다.
핵심 요약
- ES가 GRPO와 달리 엔트로피 붕괴(탐색 다양성 소멸) 없이 Pass@1과 Pass@K를 함께 높여 추론 답 다양성을 지킴을 보였다.
- GRPO로 먼저 학습하고 ES로 마무리하는 순차 조합이 두 방법의 강점을 결합했다.
- 성능 향상은 큰 폭 업데이트 일부(주로 정규화·어텐션 파라미터)에 집중돼 있어, 파라미터가 크게 움직여도 기능 변화는 드물다는 걸 보였다.
- 홀드아웃 평가에서 ES는 기존 능력을 대체로 유지해, 큰 파라미터 이동 자체가 재앙적 망각을 유발하지 않는다는 반례를 제시했다.
- z-점수 보상 정규화가 필수이고, 모델이 클수록 개체수 N=16만으로도 N=64에 근접했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.