Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement
- 발행일
- 출처
- arXiv
- 논문 번호
- 510
- 분야
- AI / General
- arXiv 번호
- 2606.27226
평가 기준을 원자적 이진 질문(yes/no)으로 분해해, 투명하고 진단 가능한 다차원 점수를 제공하는 LLM 평가 프레임워크 BINEVAL을 제안한다.
BINEVAL은 LLM 출력 평가를 원자적 이진 질문들로 분해하여, 개별 질문 수준의 피드백과 다차원 점수를 simultaneously 제공하는 training-free 평가 프레임워크다. SummEval, Topical-Chat, QAGS 벤치마크에서 UniEval, G-Eval 등 강력한 기존 방법들과 동등하거나 더 우수한 성능을 보이며, 특히 사실 일관성 평가에서 두드러진 강점을 보인다. 같은 질문 수준 피드백을 활용해 요약 및 명령어 준수 프롬프트를 반복적으로 최적화할 수 있어, 평가와 생성 개선을 하나의 프레임워크에서 통합한다.
핵심 요약
- 평가 기준을 원자적 이진 질문으로 분해하는 meta-prompt 구조로, 평가의 투명성과 진단 가능성을 크게 향상시킨다
- QAGS(사실 일관성)에서 UniEval 대비 Spearman ρ +0.195 개선 — 분해 자체가 정보 이득의 핵심 기여임을 입증
- G-Eval/UniEval이 5.0 만점을 주는 미묘한 사실 오류를 BINEVAL은 7개 질문으로 각각 포착해 1.57점으로 인간 판단(2.0)에 근접
- LLM judge의 고질적 ceiling effect를 회피해, 경계선 출력과 명확한 결함 출력을 더 잘 구분한다
- 질문 수준 피드백을 활용한 cross-model prompt update로 요약 및 IFBench 프롬프트를 모두 개선한다
- task-agnostic·training-free 설계로, 요약·대화·명령어 준수 등 다양한 태스크에 즉시 적용 가능하다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.