Demystifying Long Chain-of-Thought Reasoning in LLMs
- 발행일
- 출처
- arXiv
- 논문 번호
- 029
- 분야
- Reasoning
- arXiv 번호
- 2502.03373
IN.AI, 칭화대학교, 카네기멜런대학교의 연구진은 대규모 언어 모델(LLM)에서 긴 Chain-of-Thought(CoT) 추론의 근본적인 작동 원리를 체계적으로 조사했다.
IN.AI, 칭화대학교, 카네기멜런대학교의 연구진은 대규모 언어 모델(LLM)에서 긴 Chain-of-Thought(CoT) 추론의 근본적인 작동 원리를 체계적으로 조사했다. 이 연구는 긴 CoT의 출현, 안정성, 효율적 학습에 영향을 미치는 핵심 요인을 규명해 복잡한 추론 작업의 성능을 개선하는 방법을 입증하고, CoT 유사 패턴을 사전 학습 데이터로 추적함으로써 창발적 행동에 대한 일반적 통념에 도전했다.
핵심 요약
- 대규모 언어 모델(LLM)은 Chain-of-Thought(CoT) 프롬프팅을 사용해도 고급 수학, 과학 QA, 소프트웨어 공학 같은 복잡한 추론 영역에서 여전히 어려움을 겪는다.
- 특히 강화학습(RL) 학습의 맥락에서 긴 CoT 능력이 LLM에서 어떻게 출현하는지에 대한 이해가 제한적이다.
- CoT를 위한 RL 학습은 적절한 설계 선택이 없으면 불안정한 CoT 길이 증가, 컨텍스트 윈도우 한계를 초과하는 출력, 보상 해킹 같은 문제에 자주 부딪힌다.
- 연구진은 Llama-3.1-8B와 Qwen2.5-7B-Math 같은 모델로 지도 미세조정(SFT)과 강화학습(RL)을 결합해 긴 CoT 추론을 체계적으로 조사했다.
- 강력한 창발적 모델(QwQ-32B-Preview)에서 긴 CoT 패턴을 증류해 고품질 SFT 데이터를 큐레이션하고, 검증 가능한 보상 신호를 확장하기 위해 노이즈가 있는 웹 추출 데이터를 필터링하는 방법을 탐구했다.
- RL을 위해 N-gram 반복 페널티가 포함된 코사인 길이 스케일링 보상(Cosine Length-Scaling Reward)이라는 새로운 보상 함수를 도입해 CoT 길이를 안정화하고 학습 중 생성 행동을 제어했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.