A Survey of Reinforcement Learning for Large Reasoning Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 085
- 분야
- Reasoning / RL / Survey
- arXiv 번호
- 2509.08827
이 서베이 논문은 대규모 추론 모델(LRM)을 위한 강화학습(RL)의 발전을 체계적으로 종합하며, 인간 정렬을 넘어 검증 가능한 보상을 통해 내재적 추론 역량을 강화하는 데 초점을 맞춘다.
이 서베이 논문은 대규모 추론 모델(LRM)을 위한 강화학습(RL)의 발전을 체계적으로 종합하며, 인간 정렬을 넘어 검증 가능한 보상을 통해 내재적 추론 역량을 강화하는 데 초점을 맞춘다. 인공 초지능(ASI)을 향한 RL 확장을 위한 핵심 구성요소, 과제, 향후 방향을 규명한다.
핵심 요약
- LLM을 LRM으로 변모시키는 RL의 급속한 성공은 계산 자원, 최적 알고리즘 설계, 확장 가능한 고품질 훈련 데이터와 관련된 상당한 난관에 직면해 있다.
- LLM에 대한 기존 RL 응용은 주로 인간 정렬에 집중하여, 복잡한 추론 능력을 근본적으로 개선할 RL의 잠재력을 간과했다.
- 추론 모델을 위한 RL의 복잡하고 빠르게 진화하는 지형을 이해하고 탐색할 통합 프레임워크의 부재가 체계적인 연구 개발을 저해한다.
- 저자들은 포괄적인 문헌 검토를 수행하여, 이 분야를 보상 설계, 정책 최적화, 샘플링 전략이라는 기초 구성요소로 체계화한다.
- 이 서베이는 객관적 피드백이 있는 과제에서 추론을 강화하기 위한 핵심 패러다임으로서 '검증 가능한 보상을 활용한 강화학습(RLVR)'을 도입하고 강조한다.
- RL의 '샤프닝 대 발견' 역할과 RL과 지도 미세조정(SFT) 간의 상호작용 같은, 기초적 문제와 진행 중인 논쟁을 규명하고 논의한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.