What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
- 발행일
- 출처
- arXiv
- 논문 번호
- 588
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.08046
LLM 예측 모델의 내부 표현을 프로빙하여 언어화된 신뢰도보다 훨씬 정확한 교정을 달성하고, CoT의 불성실성을 감지하며, 추론 전 답이 정해져 있음을 발견한 연구.
LLM 예측 모델(EF-8B)의 내부 활성화에 가벼운 프로브를 훈련시켜 모델이 말하는 신뢰도보다 훨씬 정확한 교정(ECE 0.044 vs 0.093)을 달성했다. CoT가 증거 변화를 반영하지 않는 불성실 사례(23%, ρ=0.22)를 프로브가 감지하며, 방향 정확도 84%로 행동 변화를 예측한다. forced answering 실험에서 예측의 대부분이 추론 시작 전에 이미 결정되어 있으며, 이를 활용한 라우팅으로 30-47% 토큰을 절약한다.
핵심 요약
- 내부 프로브가 언어화 신뢰도보다 ECE를 절반 수준(0.044 vs 0.093)으로 낮춰 교정 성능 대폭 향상
- CoT 증거 제거 시 23% 사례에서 예측은 바뀌지만 추론 과정은 변하지 않는 불성실성 발견 (ρ=0.22)
- 프로브의 행동 변화 추적 정확도(ρ=0.57)가 CoT(ρ=0.22)를 크게 상회하며, CoT가 숨기는 영향도 84% 방향 정확도로 감지
- forced answering 실험에서 예측 답안의 상당 부분이 추론 시작 전에 이미 결정되어 있음을 확인
- 사전 추론 답 분포의 엔트로피로 질문을 3단계 분류해 30-47% 토큰 절감, 정확도 손실 없음
- GLM-4.7-Flash, GLM-4.5-Air에서도 프로브 only 교정이 유효하여 가중치 업데이트 없이 교정 개선 가능
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.