rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
- 발행일
- 출처
- arXiv
- 논문 번호
- 015
- 분야
- Math Reasoning
- arXiv 번호
- 2501.04519
테스트 시점 탐색, 검증된 합성 궤적, 선호 기반 과정 보상이 정책 모델 자체를 키우지 않고도 수학 추론 격차의 상당 부분을 메울 수 있음을 보여주는 강력한 사례다.
rStar-Math는 다단계 수학에서 소형 언어 모델의 약점을 겨냥하여, 추론을 단발 chain-of-thought 생성이 아니라 MCTS로 유도되는 심층 사고로 전환한다. 정책 SLM을 위해 코드 증강된 단계별 검증 추론 궤적을 합성하고, 깨지기 쉬운 절대 단계 라벨 대신 Q값에서 유도된 선호 쌍으로 Process Preference Model을 학습하며, 747k 수학 문제에 대해 4회에 걸쳐 정책 모델과 보상 모델을 반복적으로 공진화시킨다. 보고된 향상 폭은 크다. Qwen2.5-Math-7B는 MATH에서 58.8%에서 90.0%로, Phi3-mini-3.8B는 41.4%에서 86.4%로 상승하며, 시스템은 AIME 문제의 53.3%를 푼다. 핵심 시사점은 정교하게 설계된 자기 진화와 테스트 시점 연산을 통해 1.5B~7B 모델이 훨씬 큰 프런티어 시스템과 경쟁할 수 있다는 것이지만, 이 레시피는 무거운 MCTS 롤아웃, 실행 가능한 검증, 그리고 답을 신뢰성 있게 확인할 수 있는 도메인에 의존한다.
핵심 요약
- 방법: 추론 시점과 데이터 생성 시점 모두에 MCTS를 사용하며, 수학 정책 SLM이 단계를 제안하고 SLM 기반 Process Preference Model이 탐색을 유도한다.
- 핵심 아이디어: 순진한 단계 수준 보상 주석을 MCTS Q값에서 유도된 선호 쌍으로 대체하여, 직접적인 Q값 회귀나 결과 전용 보상보다 과정 보상 모델을 더 견고하게 만든다.
- 자기 진화: 4회의 라운드는 대형 DeepSeek-Coder 부트스트랩에서 시작해, 747k 문제에 대한 수백만 개의 검증된 해법을 사용하여 SLM-r1에서 SLM-r4로, PPM-r1에서 PPM-r4로 점진적으로 개선한다.
- 결과와 유의점: Qwen2.5-Math-7B로 MATH에서 90.0%, AIME에서 53.3%에 도달하지만, 이 접근은 연산 집약적이며 중간 또는 최종 답을 프로그래밍 방식으로 확인할 수 있는 과제에 가장 적합하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.