ExpRL: Exploratory RL for LLM Mid-Training
- 발행일
- 출처
- arXiv
- 논문 번호
- 436
- 분야
- Machine Learning
- arXiv 번호
- 2606.17024
참조 해답을 모방이 아닌 보상 스캐폴드로 활용해 LLM 추론 RL을 위한 더 나은 초기화를 제공하는 mid-training 방법을 제안한다.
ExpRL은 기존 SFT나 희소 보상 GRPO가 가진 한계(coverage 부족)를 극복하기 위해, 참조 해답을 정답 모방용이 아니라 LLM judge의 채점 기준표로 활용한다. 정책은 원본 문제만 보고 on-policy로 추론 트레이스를 생성하며, judge가 이를 참조 해답과 비교해 outcome/process 수준의 밀집 보상을 부여한다. 수학 추론 벤치마크에서 SFT, GRPO, self-distillation보다 더 강한 RL 초기화를 제공하며, pass@k와 pass@1 모두에서 유의미한 향상을 보인다.
핵심 요약
- 참조 해답을 모방 대상이 아닌 LLM judge의 채점 루브릭으로 활용하는 ExpRL-Outcome/Process 두 변종 제안
- Qwen3-4B 기준 AIME-25에서 ExpRL-Outcome이 pass@1 34.2%로 GRPO(27.1%), SFT(5.7%)를 크게 압도
- pass@k 향상이 확인되어 coverage(해결 전략 다양성) 자체가 개선됨을 입증
- 검증, 자기수정, 백트래킹 같은 추론 행동이 base model 대비 증가함을 관찰
- 4B 이상 judge에서 문제-매칭 참조가 가장 낮은 misplacement rate를 기록—judge는 참조 기반으로 검증함을 확인
- 혼합 도메인(수학+코딩+과학) 실험에서도 ExpRL이 단일 도메인 이상으로 확장 가능함을 시사
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.