The Illusion of $\textit{What If}$: Evaluating the Breakdown of Counterfactual Reasoning in LLMs

발행일
출처
arXiv
논문 번호
1051
분야
AI / General
arXiv 번호
2608.27953

최신 LLM들에게 '만약 ~라면 어땠을까' 질문 220개를 던져, 그럴듯한 답 뒤에 숨은 엉성한 인과구조를 잡아내는 평가 벤치마크를 만든 논문.

이 논문은 한마디로 LLM의 반사실(what-if) 추론이 얼마나 부실한지 드러내는 WhatIfBench 벤치마크와 평가기 PRISM을 소개한다. 기존 벤치마크는 정해진 변수·단일 정답만 다뤘지만, 이 벤치마크는 STEM·인문사회·혼합 영역의 열린 형식 질문 220개로 구성했다. PRISM은 모델의 자유 서술 답변을 사건·상태·메커니즘으로 이루어진 인과 그래프로 바꾼 뒤, 그래프 수준 인과 타당성과 답변 수준 충분성을 함께 채점한다. 최신 LLM 6개를 평가한 결과 최고 모델도 64.62%에 그쳤고, 인과 공백·전제 표류·위상 파편화 같은 실패 패턴이 반복됐다.

핵심 요약

  • 열린 도메인 what-if 질문 220개(STEM/인문사회/혼합)로 구성된 진단 벤치마크를 공개했다.
  • 자유 서술 답변을 인과 그래프(사건·상태·메커니즘의 DAG)로 변환해, 결과가 아니라 추론 과정을 채점하는 PRISM 평가기를 만들었다.
  • 최신 LLM 6개 중 최고 성적이 64.62%에 불과해, 반사실 추론이 아직 포화 상태에서 멀다는 걸 보였다.
  • 가장 흔한 실패는 '인과 공백'이었다. 그럴듯한 결과를 나열하지만 전제를 결과로 잇는 중간 다리가 빠져 있었다.
  • 유창한 서술이 엉성한 인과 과정을 감춘다는 결론으로, 구조 기반 평가의 필요성을 강조했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)