Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 631
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.12395
1조 파라미터 모델에 zero RL을 적용하여 자발적 추론 능력이 출현하는 현상을 분석한 연구.
Ring-Zero는 강화학습 기반 zero RL을 1조(1T) 파라미터 모델에까지 스케일업하여, 인간이 만든 데이터 없이도 고품질 추론 능력이 출현함을 입증했다. 단순한 알고리즘 개선(clipped importance sampling, training-inference ratio correction, mixed-precision control)만으로 안정적인 학습이 가능했으며, 학습 과정에서 발견(discovery) 단계와 정제(sharpening) 단계가 순차적으로 진행됨을 관찰했다. 1T 모델은 104B 모델 대비 압도적으로 높은 샘플 효율성과 성능 상한을 보였고, 자발적으로 구조화된 포맷팅, 자기 검증, 병렬 추론, 문맥 불안(context anxiety) 등의 고도 인지 행동을 발현했다.
핵심 요약
- 중요도 비율 자르기, 학습·추론 비율 보정, 혼합 정밀도 제어를 결합해 1조 파라미터 모델의 제로 강화학습을 안정화했다.
- 모델 규모를 1조 파라미터로 늘리자 표본 효율과 성능 상한이 높아지고 학습이 발견 단계 뒤 정제 단계로 진행됐다.
- 구조화된 형식, 자기 검증, 병렬 추론, 문맥 불안 같은 행동이 별도 규칙 없이 나타났다.
- 정답률뿐 아니라 이해 가능성, 재현 가능성, 효율성으로 사고 과정을 평가하는 틀을 제시해 대규모 추론 학습 분석에 활용할 수 있다.
- 실증은 일곱 개 수학 벤치마크와 1조 파라미터 설정에 집중되어 있어 다른 과제와 더 작은 계산 예산에 그대로 일반화되는지는 남은 문제다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.