Decoupling Exploration from Optimization in RLVR

발행일
출처
arXiv
논문 번호
1177
분야
Agents
arXiv 번호
2610.10536

검증 보상 강화학습(RLVR)에서 새로운 풀이 전략 찾기(탐험)와 성능 다듬기(최적화)를 서로 다른 모델에 나눠 맡기니, 탐험을 과감히 해도 모델이 망가지지 않고 성적도 오랐다.

이 논문은 한마디로 강화학습에서 '탐험'과 '최적화'를 한 모델에 동시에 시키면 실패한다는 문제를 푼 연구다. 탐험 보너스(새로운 풀이를 찾면 주는 점수)를 주면 실패한 풀이까지 학습돼 모델 전체가 나빠지는데, 저자들은 탐험 전용 모델(explorer)과 학습본 모델을 분리해 explorer의 옳은 풀이만 골라 증류(걸러서 학습시키는 방식)하는 ExpDis를 제안했다. 수학 벤치마크 7개에서 같은 컴퓨팅 예산의 DAPO보다 높은 성적을 냈고, pass@k도 좋아져 더 다양한 정답 풀이를 만들어냄을 보였다.

핵심 요약

  • RLVR에 탐험 보너스를 직접 넣으면 감독 밖 지식이 망가져 일반 성능이 저하됨을 확인했다.
  • 탐험 모델(explorer)과 학습본 모델을 분리하고, 옳은 풀이만 걸러 증류하는 ExpDis 프레임워크를 제안했다.
  • 수학 벤치마크 7개에서 같은 컴퓨팅 예산의 DAPO보다 평균 정확도와 pass@k 모두 앞섰다.
  • 탐험 병렬 확장(여러 explorer)과 라운드 반복을 독립적으로 늘릴수록 성능이 계속 개선됨을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)