ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

발행일
출처
arXiv
논문 번호
829
분야
AI / General
arXiv 번호
2608.03972

전문가 모델이 틀린 문제의 실패 궤적(Golden Negative Trajectory)을 버리지 말고 반성 자료로 활용하면 오히려 더 큰 학습 효과를 얻는다는 것을 보였다.

이 논문은 한마디로 수학 문제를 풀 때 전문가 모델이 틀린 답을 버리지 말고 '반성 자료'로 쓰면 더 잘 배운다는 연구다. 쉬운 문제는 정답 궤적을 모방하면 되지만, 어려운 문제에서는 정답이 없을 때가 많다. ReflectRL은 전문가의 틀린 풀이를 먼저 보고 반성(Reflective Reasoning)하게 한 뒤, 점차 그 능력을 힌트 없이 푸는 능력(Direct Reasoning)으로 전이한다. RLVR과 OPD 모두에 플러그인으로 붙여서 일관된 향상을 얻었다.

핵심 요약

  • 전문가 모델의 실패 궤적(GNT)이 자체 실패나 약한 모델 실패보다 반복 학습에 훨씬 효과적임을 입증했다.
  • GNT는 정답에 가까운 valid prefix와 국소적 오류 지점을 모두 포함해 반성 학습의 질 높은 자료가 된다.
  • Reflective-to-Direct Policy Transition로 힌트 의존에서 점차 자력 풀이로 능력을 전이시킨다.
  • 9개 벤치마크, 4개 모델(1.5B~8B), 4개 학습 방법에서 일관된 정확도 향상을 달성했다.
  • 응답 길이를 절반 이하로 줄이면서도 정확도는 올리고, 엔트로피 붕괴도 방지했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)