The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality

발행일
출처
arXiv
논문 번호
097
분야
Benchmarks / Factuality
arXiv 번호
2512.10791

Google이 주도한 연구 협업이 멀티모달 이해, 내부 지식 회상, 검색 증강 생성, 컨텍스트 기반 근거 확보 등 다양한 시나리오에서 대형 언어 모델(LLM)의 사실성을 평가하기 위해 Kaggle에 호스팅된 포괄적 벤치마크 모음 The FACTS Leaderboard를 도입한다.

Google이 주도한 연구 협업이 멀티모달 이해, 내부 지식 회상, 검색 증강 생성, 컨텍스트 기반 근거 확보 등 다양한 시나리오에서 대형 언어 모델(LLM)의 사실성을 평가하기 위해 Kaggle에 호스팅된 포괄적 벤치마크 모음 The FACTS Leaderboard를 도입한다. 선두 모델인 Gemini 3 Pro는 전체 FACTS 점수 68.8%를 달성했는데, 이는 현재 LLM의 사실적 신뢰성에 개선의 여지가 상당함을 보여준다.

핵심 요약

  • 대형 언어 모델(LLM)은 사실과 다른 부정확한 정보를 자주 생성하여, 실제 응용에서의 신뢰할 수 있는 배포를 저해한다.
  • LLM 사실성에 대한 기존 벤치마크는 흔히 좁은 능력(예: 컨텍스트 기반 또는 일반 지식 회상)에 집중하여 총체적 평가를 제공하지 못한다.
  • 실제 LLM 응용은 서로 다른 양식과 지식 소스에 걸친 사실적 능력의 조합을 요구하는데, 현재의 평가 프레임워크는 이를 적절히 다루지 못한다.
  • The FACTS Leaderboard는 FACTS Multimodal, FACTS Parametric, FACTS Search, FACTS Grounding v2의 네 가지 별개의 하위 리더보드로 구성되며, 각각 LLM 사실성의 특정 차원을 평가한다.
  • 이 벤치마크는 인간 주석과 비교해 엄밀히 검증된 정교한 자동 심판을 활용하여, 수천 개의 다양한 질문에 걸쳐 모델 응답을 평가한다.
  • 모든 평가는 Kaggle에 의해 공정하게 수행되며, 공개 및 비공개 데이터 분할을 갖추어 벤치마크의 무결성을 보장하고 과적합을 완화한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)