Bayesian Teaching Enables Probabilistic Reasoning in Large Language Models

발행일
출처
arXiv
논문 번호
122
분야
Reasoning / Probabilistic
arXiv 번호
2503.17523

한 연구는 대규모 언어 모델이 암묵적 확률 추론에 어려움을 겪는 반면, '베이즈 교육'이라는 표적 미세조정 전략이 이러한 적응적 능력을 효과적으로 부여하여 다양한 과제와 실제 상호작용 전반에 걸친 폭넓은 일반화로 이어진다는 것을 입증했다.

한 연구는 대규모 언어 모델이 암묵적 확률 추론에 어려움을 겪는 반면, '베이즈 교육'이라는 표적 미세조정 전략이 이러한 적응적 능력을 효과적으로 부여하여 다양한 과제와 실제 상호작용 전반에 걸친 폭넓은 일반화로 이어진다는 것을 입증했다. 이 접근법은 추천 정확도와 규범적 베이즈 추론과의 정합성을 향상시켰으며, 인간과 유사한 잡음을 가진 기준 모델까지 능가했다.

핵심 요약

  • 기성 대규모 언어 모델(LLM)은 불확실하고 상호작용적인 환경에서 확률적 믿음을 효과적으로 형성하고 갱신하는 능력이 부족하다.
  • 현재의 LLM은 여러 상호작용에 걸쳐 관찰된 행동으로부터 잠재 상태(예: 사용자 선호)를 암묵적으로 추론하는 데 낮은 성능을 보인다.
  • 이들의 추천 정확도는 흔히 일찍 정체되는데, 이는 새로운 정보에 기반한 동적 믿음 갱신에서의 근본적 한계를 시사한다.
  • 저자들은 LLM을 규범적 베이즈 어시스턴트가 생성한 데이터로 학습시키는 지도 미세조정 전략인 '베이즈 교육'을 개발했다.
  • 베이즈 어시스턴트는 베이즈 정리를 사용해 사용자 선호에 대한 확률 분포를 유지하고 갱신하며 확률적으로 최적인 추천을 수행한다.
  • 이 접근법은 완전한 지식을 가진 어시스턴트의 일관되게 정답인 답변으로 LLM을 미세조정하는 '오라클 교육'과 비교되었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)