JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

발행일
출처
arXiv
논문 번호
1122
분야
AI Agents
arXiv 번호
2609.26550

값싼 '판결만 하는' 심판 모델이 확신 있을 때는 바로 판정하고 애매할 때만 비싼 LLM 심판으로 넘기는 캐스케이드 평가 전략을 검증한 논문이다.

이 논문은 한마디로 평가 비용을 몇백 분의 일로 줄이면서 정확도는 거의 유지하는 이중 심판 구조를 검증했다. 판결과 확률만 출력하는 저렴한 판정 전용 심판(JEV)을 16개 생성형 심판·보상모델과 비교했다. 보통 선호 판단이나 근거 기반 사실 확인에서는 최고 성능 심판과 3% 포인트 이내 차이를 냈고, 비용은 0.36%만 들었다. 확신 있는 판정은 통과시키고 불확실한 판정만 상위 모델로 올리는 고정 캐스케이드는 정확도의 99%를 유지했다.

핵심 요약

  • 판결+확률만 출력하는 저렴한 심판(JEV)을 생성형 LLM 심판 16개와 공정 비교했다
  • 일반 선호·근거 기반 사실 판단에서 최고 심판과 3% 포인트 이내 차이를 냈다
  • 측정 비용은 최고 성능 비교군의 0.36%에 불과했다 ($0.042/백만 입력 토큰)
  • 확신 있으면 수용, 불확실하면 상위 심판으로 넘기는 캐스케이드가 정확도 99%를 유지했다
  • 수식 유도 검증이나 그럴듯한 오답 저항 같은 어려운 판단에서는 한계가 뚜렷했다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)