Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

발행일
출처
arXiv
논문 번호
396
분야
Machine Learning
arXiv 번호
2606.12370

RL 훈련 중 MTP 수용률 저하의 원인이 entropy 변동임을 규명하고, end-to-end TV loss로 95% 수용률을 달성해 RL 훈련을 1.8배 가속한다.

LLM 강화학습에서 롤아웃이 주요 병목인 상황에서 Multi-Token Prediction(MTP)를 통한 speculative decoding 가속은 entropy 상승으로 수용률이 급락하는 한계가 있다. Bebop은 수용률 저하의 핵심 원인이 정책-드래프트 불일치가 아닌 entropy 변동임을 실증하고, 확률적 rejection sampling과 새로운 end-to-end TV loss를 결합해 수용률을 95%까지 끌어올린다. Qwen3.5/3.6/3.7에서 비동기 RL 파이프라인 최대 1.8배 가속을 달성했으며, RL 전 사전 학습만으로 온라인 MTP 갱신이 불필요함을 보였다.

핵심 요약

  • MTP 수용률과 정책 entropy 간의 명확한 부적 선형 관계 발견: entropy 상승 → 수용률 직선 하락
  • greedy target-only 대비 probabilistic rejection sampling이 entropy 변동에 훨씬 강건함을 수학적/실증적 입증
  • 종래 CE/KL 손실 대신 rejection sampling 수용률을 직접 최적화하는 end-to-end TV loss 제안, ~10%p 수용률 향상
  • RL 전 경량 MTP 사전 학습만으로 전체 RL 과정에서 일정한 수용률 유지, 온라인 MTP 동시 훈련 불필요
  • 수학 추론/코드 생성/에이전트 과제 전반에서 최대 95% 수용률, 25% 추론 처리량 추가 향상
  • Qwen3.5/3.6/3.7 비동기 RL 파이프라인에서 최대 1.8배 end-to-end 가속 달성

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)