Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought
- 발행일
- 출처
- arXiv
- 논문 번호
- 014
- 분야
- Reasoning
- arXiv 번호
- 2501.04682
이 논문은 또 하나의 CoT 프롬프팅 기법이 아니라, 테스트 시점의 탐색과 검증을 학습 가능한 내부 추론 행동으로 전환하기 위한 로드맵으로 읽는 것이 가장 좋다.
Meta Chain-of-Thought는 추론을 가시적인 답 뒤에 놓인 잠재 탐색 과정 z로 재정의하여, CoT를 단계 서술에서 가능한 해법 경로에 대한 선택과 검증, 역추적으로 확장한다. 이 논문은 이 관점을 System 2 추론과 연결하며, o1 계열 시스템 같은 프런티어 모델은 이미 맥락 내 탐색의 흔적을 보이는 반면 일반적인 단일 패스 LLM은 실패한 추론을 수정하는 데 여전히 취약하다고 주장한다. 제안하는 레시피는 과정 보상 모델, MCTS나 A* 같은 탐색 알고리즘에서 생성한 합성 트레이스, 선형화된 탐색에 대한 지시 튜닝, RL 사후 학습을 결합하며, 이 과제를 위한 대규모 검증 가능 수학 코퍼스로 Big MATH를 도입한다. 핵심 가치는 단일 벤치마크 우승이 아니라 개념적·인프라적 측면에 있다. 즉 검증기와 생성기 간 격차, 스케일링 문제, 알고리즘 발견 잠재력을 내재화된 추론의 핵심 연구 과제로 짚어낸다.
핵심 요약
- Meta-CoT를 p(y|x)=∫p(y|x,z)p(z|x)dz로 정의하며, 여기서 z는 직접 지도되는 최종 설명이 아니라 숨겨진 추론·탐색 궤적을 가리킨다.
- 표준 CoT의 한계를 겨냥한다. 단발 생성, 약한 자기 검증, 부족한 역추적, 어려운 수학·논리·계획 과제에서의 취약한 탐색적 추론이 그것이다.
- 과정 지도, 과정 보상 모델(PRM), MCTS나 A* 같은 알고리즘에서 얻은 합성 탐색 트레이스, 지시 튜닝, RL 사후 학습을 활용해 탐색 같은 행동을 내재화하는 학습 파이프라인을 제안한다.
- 더 크고 프런티어급인 모델일수록 더 긴 추론 시점 연산으로 복잡한 해법에 근접할 수 있다는 정성적·경험적 신호를 보고하지만, 미해결된 스케일링·검증기·일관성 문제를 부각한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.