PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs
- 발행일
- 출처
- arXiv
- 논문 번호
- 1188
- 분야
- LLMs / NLP
- arXiv 번호
- 2610.10455
환각(잘못된 정보)이 이미 들어온 상황에서 LLM이 이를 어떻게 처리하는지(따르기/회피/수정) 행동으로 쪼개 평가한 벤치마크다. 성공적 회복은 드물고, 프롬프트 특징만으로 AUROC 0.847로 예측 가능하다.
이 논문은 한마디로 이미 환각 정보가 흘러들어온 뒤 모델이 어떻게 회복하는지 행동 단위로 평가한 벤치마크다. 저자들은 Chemistry/Biomedicine/Physics/Code 4개 도메인 4820개 통제 인스턴스로 18개 모델을 평가하고, 응답을 '순응/회피/수정' 3가지 행동으로 분류했다. 환각 맥락은 평균 7.7%p 정확도를 떨어뜨렸고, 모델이 클수록 더 크게 흔들리면서도 수정 행동은 더 자주 나타나는 스케일링 긴장이 관찰됐다. 성공적 회복은 드물지만 더 잦은 믿음 갱신(belief update)과 함께 나타났고, 프롬프트 특징만으로 사전 예측이 AUROC 0.847에 달했다.
핵심 요약
- 최종 정답만 보면 순응·회피·수정이 구분 안 되므로, 응답 궤적을 3가지 행동(Hallucination Compliance/Avoidance/Heuristic Correction)으로 독립 분류하는 프레임워크를 만들었다.
- 환각 맥락이 평균 7.7%p 정확도를 떨어뜨렸고, 여러 모델 계열에서 규모가 클수록 더 취약해지면서도 수정 행동은 더 잦아지는 '스케일링 긴장'을 발견했다.
- 성공적 회복(수정+정답 도달)은 드물며, 회복에 성공한 궤적은 더 잦은 믿음 갱신을 보이는 특징이 있었다.
- 프롬프트 수준의 구조·의미 특징만으로 생성 전에 회복 성공을 예측해 가벼운 예측기가 AUROC 0.847, 정확도 0.863을 달성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.