ExpRL: Exploratory RL for LLM Mid-Training

발행일
출처
arXiv
논문 번호
436
분야
Machine Learning
arXiv 번호
2606.17024

참조 해답을 모방이 아닌 보상 스캐폴드로 활용해 LLM 추론 RL을 위한 더 나은 초기화를 제공하는 mid-training 방법을 제안한다.

ExpRL은 기존 SFT나 희소 보상 GRPO가 가진 한계(coverage 부족)를 극복하기 위해, 참조 해답을 정답 모방용이 아니라 LLM judge의 채점 기준표로 활용한다. 정책은 원본 문제만 보고 on-policy로 추론 트레이스를 생성하며, judge가 이를 참조 해답과 비교해 outcome/process 수준의 밀집 보상을 부여한다. 수학 추론 벤치마크에서 SFT, GRPO, self-distillation보다 더 강한 RL 초기화를 제공하며, pass@k와 pass@1 모두에서 유의미한 향상을 보인다.

핵심 요약

  • 참조 해답을 모방 대상이 아닌 LLM judge의 채점 루브릭으로 활용하는 ExpRL-Outcome/Process 두 변종 제안
  • Qwen3-4B 기준 AIME-25에서 ExpRL-Outcome이 pass@1 34.2%로 GRPO(27.1%), SFT(5.7%)를 크게 압도
  • pass@k 향상이 확인되어 coverage(해결 전략 다양성) 자체가 개선됨을 입증
  • 검증, 자기수정, 백트래킹 같은 추론 행동이 base model 대비 증가함을 관찰
  • 4B 이상 judge에서 문제-매칭 참조가 가장 낮은 misplacement rate를 기록—judge는 참조 기반으로 검증함을 확인
  • 혼합 도메인(수학+코딩+과학) 실험에서도 ExpRL이 단일 도메인 이상으로 확장 가능함을 시사

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)