LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

발행일
출처
arXiv
논문 번호
668
분야
Machine Learning
arXiv 번호
2607.18110

채점자 역할의 LLM을 점수 대신 글로 된 조언을 뽑는 코치로 바꿔, 정답이 없는 열린 과제 학습을 강화학습보다 잘 시킨 연구다.

정답을 기계로 확인할 수 없는 열린 과제에서는 보통 LLM 심사자가 매긴 점수 하나로 강화학습을 돌린다. 이때 심사자가 쓴 긴 평가 글은 버려지고, 같은 점수를 받은 서로 다른 품질의 답이 구분되지 않는다. 저자들은 같은 심사 모델을 코치로 다시 쓰는 Experiential Learning(EL, 경험 학습)을 제안한다. 코치가 뽑은 재사용 가능한 조언을 교사 모델의 문맥으로 넣고, 정책 모델이 자기 응답 위에서 토큰 단위 역 KL을 줄이며 그 조언을 파라미터에 흡수한다. 두 정책 계열과 두 종류 피드백 모델에서 EL이 루브릭 기반 강화학습을 일관되게 앞섰고, 학습 분포 밖 일반화가 더 좋았으며 보상 해킹도 줄었다.

핵심 요약

  • 점수 하나로 압축된 보상은 정보 병목이라, 특히 상위권에서 같은 최고점을 받은 답들을 구분하지 못한다는 문제 제기다.
  • 해법은 같은 피드백 모델을 심사자 대신 코치로 쓰는 것이다. 코치는 응답 평가를 일반화된 재사용 가능한 조언(경험 지식)으로 정리한다.
  • 그 조언을 교사 모델의 문맥으로 주고, 정책이 뽑은 응답을 따라 토큰 단위 역 KL 발산을 줄이는 온폴리시 문맥 증류로 정책에 내재화한다. 추론 때는 코치도 조언 문맥도 필요 없다.
  • 피드백 대역폭 비교로 동기를 설명한다. 1~10 정수 점수는 표본당 3.3비트, 어휘 15만에서 1024토큰 조언은 이론상 1만7600비트다.
  • 두 정책 계열에서, 피드백 모델이 정책 자신이든 상용 API 모델이든, EL이 루브릭 기반 강화학습보다 held-out 및 처음 보는 벤치마크에서 더 좋았다.
  • 강화학습은 보상을 좇아 학습셋 보상 과최적화(보상 해킹)에 빠지기 쉬운 반면, EL은 교사 분포를 따라가는 분포 정합이라 그 실패가 줄어든다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)