A Survey of Reinforcement Learning for Large Reasoning Models

발행일
출처
arXiv
논문 번호
085
분야
Reasoning / RL / Survey
arXiv 번호
2509.08827

이 서베이 논문은 대규모 추론 모델(LRM)을 위한 강화학습(RL)의 발전을 체계적으로 종합하며, 인간 정렬을 넘어 검증 가능한 보상을 통해 내재적 추론 역량을 강화하는 데 초점을 맞춘다.

이 서베이 논문은 대규모 추론 모델(LRM)을 위한 강화학습(RL)의 발전을 체계적으로 종합하며, 인간 정렬을 넘어 검증 가능한 보상을 통해 내재적 추론 역량을 강화하는 데 초점을 맞춘다. 인공 초지능(ASI)을 향한 RL 확장을 위한 핵심 구성요소, 과제, 향후 방향을 규명한다.

핵심 요약

  • LLM을 LRM으로 변모시키는 RL의 급속한 성공은 계산 자원, 최적 알고리즘 설계, 확장 가능한 고품질 훈련 데이터와 관련된 상당한 난관에 직면해 있다.
  • LLM에 대한 기존 RL 응용은 주로 인간 정렬에 집중하여, 복잡한 추론 능력을 근본적으로 개선할 RL의 잠재력을 간과했다.
  • 추론 모델을 위한 RL의 복잡하고 빠르게 진화하는 지형을 이해하고 탐색할 통합 프레임워크의 부재가 체계적인 연구 개발을 저해한다.
  • 저자들은 포괄적인 문헌 검토를 수행하여, 이 분야를 보상 설계, 정책 최적화, 샘플링 전략이라는 기초 구성요소로 체계화한다.
  • 이 서베이는 객관적 피드백이 있는 과제에서 추론을 강화하기 위한 핵심 패러다임으로서 '검증 가능한 보상을 활용한 강화학습(RLVR)'을 도입하고 강조한다.
  • RL의 '샤프닝 대 발견' 역할과 RL과 지도 미세조정(SFT) 간의 상호작용 같은, 기초적 문제와 진행 중인 논쟁을 규명하고 논의한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)