PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs

발행일
출처
arXiv
논문 번호
1188
분야
LLMs / NLP
arXiv 번호
2610.10455

환각(잘못된 정보)이 이미 들어온 상황에서 LLM이 이를 어떻게 처리하는지(따르기/회피/수정) 행동으로 쪼개 평가한 벤치마크다. 성공적 회복은 드물고, 프롬프트 특징만으로 AUROC 0.847로 예측 가능하다.

이 논문은 한마디로 이미 환각 정보가 흘러들어온 뒤 모델이 어떻게 회복하는지 행동 단위로 평가한 벤치마크다. 저자들은 Chemistry/Biomedicine/Physics/Code 4개 도메인 4820개 통제 인스턴스로 18개 모델을 평가하고, 응답을 '순응/회피/수정' 3가지 행동으로 분류했다. 환각 맥락은 평균 7.7%p 정확도를 떨어뜨렸고, 모델이 클수록 더 크게 흔들리면서도 수정 행동은 더 자주 나타나는 스케일링 긴장이 관찰됐다. 성공적 회복은 드물지만 더 잦은 믿음 갱신(belief update)과 함께 나타났고, 프롬프트 특징만으로 사전 예측이 AUROC 0.847에 달했다.

핵심 요약

  • 최종 정답만 보면 순응·회피·수정이 구분 안 되므로, 응답 궤적을 3가지 행동(Hallucination Compliance/Avoidance/Heuristic Correction)으로 독립 분류하는 프레임워크를 만들었다.
  • 환각 맥락이 평균 7.7%p 정확도를 떨어뜨렸고, 여러 모델 계열에서 규모가 클수록 더 취약해지면서도 수정 행동은 더 잦아지는 '스케일링 긴장'을 발견했다.
  • 성공적 회복(수정+정답 도달)은 드물며, 회복에 성공한 궤적은 더 잦은 믿음 갱신을 보이는 특징이 있었다.
  • 프롬프트 수준의 구조·의미 특징만으로 생성 전에 회복 성공을 예측해 가벼운 예측기가 AUROC 0.847, 정확도 0.863을 달성했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)