Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
- 발행일
- 출처
- arXiv
- 논문 번호
- 060
- 분야
- Reasoning / RL
- arXiv 번호
- 2504.13837
Tsinghua University의 연구는 현재의 검증 가능한 보상 기반 강화 학습(RLVR)이 주로 이미 존재하는 추론 패턴에 대한 대규모 언어 모델의 샘플링 효율을 향상시킨다는 점을 밝혀낸다.
Tsinghua University의 연구는 현재의 검증 가능한 보상 기반 강화 학습(RLVR)이 주로 이미 존재하는 추론 패턴에 대한 대규모 언어 모델의 샘플링 효율을 향상시킨다는 점을 밝혀낸다. 이러한 최적화는 종종 더 높은 pass@k 값에서 모델의 전반적 추론 능력을 좁히는데, 이는 문제 해결 범위를 효과적으로 확장하는 증류와 대조된다.
핵심 요약
- 전통적 RL이 새로운 전략을 발견하는 것과 유사하게, RLVR이 LLM에 새로운 추론 능력을 획득하게 한다는 통념이 있다.
- 현재의 RLVR이 LLM이 풀 수 있는 문제의 범위를 진정으로 확장하는지, 아니면 단지 기존 해법의 샘플링을 최적화할 뿐인지에 대한 엄밀한 조사가 없다.
- 전통적 평가 지표는 LLM의 전체 추론 잠재력이나 '추론 능력 경계'를 정확히 포착하지 못하는 경우가 많다.
- k회 시도 내에 풀 수 있는 문제의 비율을 측정하여 LLM의 '추론 능력 경계'를 정의하는 견고한 평가 지표로 pass@k를 도입했다.
- 다양한 LLM 계열, 크기, 여러 RL 알고리즘(PPO, GRPO 등), 다양한 과제 영역(수학, 코드, 시각적 추론) 전반에 걸쳐 추론 능력을 체계적으로 평가했다.
- RLVR이 생성한 추론 경로가 새로운 것인지 아니면 이미 기반 모델의 분포 안에 있는지 판단하기 위해, 퍼플렉서티 분석과 해결 가능 문제 커버리지를 포함한 심층 분석 기법을 활용했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.