RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

발행일
출처
arXiv
논문 번호
333
분야
Machine Learning
arXiv 번호
2606.06475

추론 모델의 사고사슬에서 핵심 구간에 보상을 재분배해 GRPO의 고분산 문제를 완화하는 방법이다.

RREDCoT는 강화학습 기반 추론 언어모델의 지연 보상 문제를 해결하기 위해 사고사슬(CoT) 구간 수준에서 보상을 재분배하는 방법이다. 기존 GRPO는 몬테카를로 방법으로 분산이 높은 반면, RREDCoT는 모델 자체를 활용해 추가 생성 없이 최적 보상 재분배를 근사한다. 정답 도달에 중요한 CoT 구간에 더 높은 보상을 할당하는 credit assignment를 수행하며, CoT 분할 방식과 상태 가치 추정 등 설계 선택을 분석한다.

핵심 요약

  • 사고사슬의 지연 보상 문제를 구간 수준 보상 재분배로 해결한다.
  • 모델 자체를 활용해 추가 생성 없이 최적 보상 재분배를 근사한다.
  • 몬테카를로 샘플링 대비 계산 오버헤드를 크게 줄인다.
  • 정답 도달에 기여하는 CoT 구간을 식별해 credit assignment를 수행한다.
  • CoT 분할 방식과 상태 가치 추정 방법의 설계 선택을 체계적으로 분석한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)