Rethinking Reflection in Pre-Training

발행일
출처
arXiv
논문 번호
056
분야
Pre-training / Reasoning
arXiv 번호
2504.04022

Essential AI의 연구는 대규모 언어 모델의 성찰적 추론 능력이 사전 학습 단계에서 출현하여 꾸준히 향상됨을 보여주며, 이러한 능력이 오직 사후 학습의 결과라는 통념에 도전한다.

Essential AI의 연구는 대규모 언어 모델의 성찰적 추론 능력이 사전 학습 단계에서 출현하여 꾸준히 향상됨을 보여주며, 이러한 능력이 오직 사후 학습의 결과라는 통념에 도전한다. 이 연구는 새로운 적대적 데이터셋을 사용해 성찰을 체계적으로 측정하고, 사전 학습 계산량과 명시적·암묵적 성찰(자기 교정 포함)의 발달 사이에 강한 상관관계가 있음을 입증한다.

핵심 요약

  • 대규모 언어 모델의 '성찰' 같은 복잡한 인지 능력이 주로 사후 학습 단계(미세 조정, 강화 학습 등)에서 출현한다는 통념이 있다.
  • 다양한 사전 학습 단계 전반에 걸쳐 성찰을 측정하는 체계적이고 확장 가능한 방법이 없다.
  • 표준 추론 데이터셋을 사용한 성찰 벤치마킹은 성찰 행동이 희소하고 오류 패턴이 다양하여 어렵다.
  • 세밀한 측정 프레임워크를 제공하기 위해 성찰의 여러 측면(상황적, 자기, 명시적, 암묵적)을 정의했다.
  • 추론 사슬에 인간과 유사한 오류를 도입하여 성찰을 체계적으로 유도하고 측정하기 위해, 적대적 사고 사슬(CoT) 데이터셋을 생성하는 프로그래밍 방식을 개발했다.
  • 프롬프트 기반 LLM 분류기를 사용해 명시적 성찰을 탐지하고 네 가지 핵심 지표인 정확도, 명시적 성찰 비율, 명시적 성찰 정확도, 암묵적 성찰 정확도를 측정했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)