Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs
- 발행일
- 출처
- arXiv
- 논문 번호
- 041
- 분야
- Reasoning / RL
- arXiv 번호
- 2503.01307
Stanford University 연구진은 검증과 백트래킹 같은 인지 행동을 보이는 언어 모델의 초기 역량이 강화 학습을 통한 자기 개선 능력을 좌우한다는 사실을 밝혀냈다.
Stanford University 연구진은 검증과 백트래킹 같은 인지 행동을 보이는 언어 모델의 초기 역량이 강화 학습을 통한 자기 개선 능력을 좌우한다는 사실을 밝혀냈다. 이러한 자기 개선 능력은 해당 행동이 풍부한 데이터로 모델을 프라이밍하거나 사전 학습 데이터를 큐레이션함으로써 유도될 수 있으며, 프라이밍 데이터에 틀린 해답이 포함되어 있어도 마찬가지다.
핵심 요약
- 일부 대규모 언어 모델(LLM)은 검증 가능한 추론 작업에 대한 강화 학습(RL)을 통해 상당한 자기 개선을 달성하는 반면, 다른 모델은 동일한 학습에도 빠르게 정체된다.
- LLM이 추가 연산 자원을 자기 개선에 효과적으로 활용할 수 있게 하는 근본적인 본질적 특성이나 초기 역량이 무엇인지는 불분명하게 남아 있었다.
- LLM 추론에서 RL 기반 자기 개선의 성공과 실패를 결정짓는 기초적 특성에 대한 이해가 부족했다.
- GPT-4o-mini 분류기를 사용해 LLM 추론 궤적에서 네 가지 인지 행동(검증, 백트래킹, 하위 목표 설정, 역방향 연쇄)을 식별·정량화하는 프레임워크를 개발했다.
- 자기 개선 역량이 서로 다른 모델(Qwen-2.5-3B 대 Llama-3.2-3B)을 대상으로 Countdown 게임에서 비교 강화 학습(RL) 실험을 수행했다.
- 특정 인지 행동이 풍부한 합성 데이터로 모델을 파인튜닝하고 이러한 행동을 증폭하도록 사전 학습 데이터를 큐레이션하는 등 표적 개입을 적용해 자기 개선을 유도했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.