How to Train a Critic Stably and Efficiently

발행일
출처
arXiv
논문 번호
1000
분야
Machine Learning
arXiv 번호
2608.23566

이 논문은 LLM 강화학습에서 불안정하다고 여겨진 크리틱(가치평가기)을 체계적인 요리법으로 안정적으로 훈련시키면, 그룹 샘플링(GRPO) 없이도 성능이 나온다는 것을 보였다.

이 논문은 한마디로 '크리틱 훈련 설계서'다. 저자들은 크리틱 기반 학습이 무너지는 원인을 통제 실험으로 하나씩 격리해내고, 값 범위 제한·몬테카를로 타깃·비정규화 어드밴티지 등을 조합한 BPCO 레시피를 만들었다. 프롬프트당 응답 1개만으로 GRPO와 동등 이상의 성능을 1.5B~30B MoE 모델에서 달성했다. 크리틱은 훈련 후 버려지므로 정답지·채점기준 같은 특권 정보를 크리틱만 보게 줄 수도 있다.

핵심 요약

  • 크리틱 불안정의 원인(무한정 값 예측, 배치 단위 정규화 등)을 통제 실험으로 하나씩 분리했다.
  • DPPO+보상 범위 제한+몬테카를로 타깃+비정규화 어드밴티지를 결합한 BPCO 레시피를 제안했다.
  • 프롬프트당 응답 1개만 샘플링해도 그룹 기반(GRPO) 기준선과 동등 이상을 달성했다.
  • 크리틱은 훈련에서만 쓰이므로 정답이나 채점 루브릭처럼 정책에 감춰야 할 정보를 크리틱에만 넣을 수 있고, 덕분에 루브릭으로 보상을 주는 과제까지 강화학습을 넓힐 수 있다.
  • 다만 근거가 수학과 루브릭 보상에 한정되고, 보상 범위를 미리 알아야 하며, 크리틱 훈련이 더 쓰는 연산과 메모리는 비교에 반영되지 않았다고 논문은 밝힌다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)