Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

발행일
출처
arXiv
논문 번호
324
분야
LLMs / NLP
arXiv 번호
2606.05122

대규모 언어 모델이 점점 다른 모델에 의해 평가되면서 자연스러운 질문이 제기된다. 모델은 심판이 자신의 출력을 어떻게 채점할지 예측할 수 있는가? 이 능력은 어떤 표적 학습 이전에도 대체로 존재한다. 퓨샷 프롬프트만으로 기본 모델은 이미 세 가지 벤치마크 전반에서 개방형 응답에 대한 외부 심판의 다속성 품질 점수를 우연 수준을 훨씬 웃돌게 예측한다.

이 연구는 언어 모델이 자신의 답변을 외부 심판 모델이 어떻게 채점할지 미리 가늠하는 능력을 이미 갖고 있는지 살펴본다. 기본 모델도 몇 개의 예시만 주면 세 가지 벤치마크에서 우연보다 훨씬 잘 여러 품질 점수를 예측했다. 저자들은 답변 개선과 채점 예측을 함께 학습한 뒤, 답변은 건드리지 않고 예측만 다듬는 SEE 절차를 제안한다. SEE는 강화학습 비교 방법보다 약 31배 적은 160개 고유 예제로 답변 품질을 유지하면서 보정 성능을 높였다. 다만 실험은 한 기본 모델과 언어 모델 심판 계열에 한정됐고 사람 평가가 없어, 사람의 선호까지 잘 맞춘다고 보기는 어렵다.

핵심 요약

  • 이 논문은 이 능력이 어떤 표적 학습 이전에도 대체로 존재함을 발견한다. 퓨샷 프롬프트만으로 기본 모델은 이미 세 가지 벤치마크 전반에서 개방형 응답에 대한 외부 심판의 다속성 품질 점수를 우연 수준을 훨씬 웃돌게 예측한다.
  • 강화 학습 베이스라인보다 약 31배 적은 160개의 고유 예제로부터, SEE는 답변 품질을 유지하면서 세 가지 벤치마크 전반에 걸쳐 홀드아웃 보정을 개선한다.
  • 이 결과들은 심판 정렬 자기 평가를 획득이 아니라 도출의 문제로 재구성한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)