Hallucinations Undermine Trust; Metacognition is a Way Forward

발행일
출처
arXiv
논문 번호
215
분야
AI Safety / Trust
arXiv 번호
2605.01428

충실한 불확실성, 즉 모델이 말하는 바를 그것이 믿는 바와 일치시키는 것이야말로 단순히 지식을 확장하거나 오류를 줄이는 것을 넘어 신뢰할 수 있는 AI를 위한 빠진 조각이라고 주장한다.

Google Research와 Tel Aviv University의 이 입장 논문은 대부분의 개선이 모델이 모르는 것에 대한 인식을 향상시키기보다 모델이 아는 것을 확장하는 데 그쳤기 때문에 LLM의 환각이 지속된다고 주장한다. 저자들은 모델이 진실과 오류를 완벽하게 분리할 변별력을 갖추지 못하여, 환각 제거와 유용성 보존 사이에 상충 관계가 발생한다고 추측한다. 이들은 충실한 불확실성, 즉 언어적 출력을 내부 확신도와 일치시키는 것을 제3의 길로 제안한다. 이는 환각을 모든 오류가 아니라 확신에 찬 오류로 재정의하는 것으로, 적절히 유보된 답변은 환각이 아니라 가설이라는 의미다. 논문은 이 프레임워크를 메타인지가 도구 사용, 탐색 결정, 신념 갱신의 제어 계층이 되는 에이전트 시스템으로 확장한다. 저자들은 메타인지적 프롬프팅, 불확실성 표현을 위한 파인튜닝, 그리고 더 나은 평가 벤치마크에 대한 연구를 촉구한다.

핵심 요약

  • 핵심 논지: 대부분의 사실성 향상은 그 경계에 대한 인식, 즉 아는 것과 모르는 것을 구분하는 것을 개선하기보다 지식의 경계를 확장하는 데서 비롯된다.
  • 변별 격차: 모델은 진실과 오류를 완벽하게 분리하는 능력을 근본적으로 결여할 수 있으며, 이는 환각 제거와 유용성 보존 사이에 내재된 상충 관계를 만든다.
  • 충실한 불확실성: 언어적 불확실성, 즉 모델이 말하는 것을 본질적 불확실성, 즉 모델이 믿는 것과 일치시킬 것을 제안하며, 답하거나 유보하거나를 넘어선 제3의 길을 제시한다.
  • 에이전트를 위한 메타인지: 에이전트 시스템에서 불확실성 인식은 언제 탐색할지, 무엇을 신뢰할지, 검색된 정보를 어떻게 가중할지를 관장하는 제어 계층이 된다.
  • 실증적 증거: 진실성 탐침의 빈약한 일반화, 확신에 찬 환각, 그리고 정렬 기법의 실패는 모두 변별 격차의 존재를 뒷받침한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)