Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
- 발행일
- 출처
- arXiv
- 논문 번호
- 090
- 분야
- LLMs / Reasoning
- arXiv 번호
- 2510.18855
Inclusion AI의 Ling Team이 고급 추론이 가능한 최초의 오픈소스 1조 매개변수 Mixture-of-Experts(MoE) 모델 Ring-1T를 공개했으며, 이는 IMO-2025에서 은메달급 성적을 달성하고 경쟁 프로그래밍 및 복잡한 문제 해결에서 오픈소스 벤치마크를 선도한다.
Inclusion AI의 Ling Team이 고급 추론이 가능한 최초의 오픈소스 1조 매개변수 Mixture-of-Experts(MoE) 모델 Ring-1T를 공개했으며, 이는 IMO-2025에서 은메달급 성적을 달성하고 경쟁 프로그래밍 및 복잡한 문제 해결에서 오픈소스 벤치마크를 선도한다.
핵심 요약
- 오픈소스 1조 매개변수 '사고 모델'의 부재로 인해 더 넓은 AI 연구 커뮤니티가 고급 추론 능력에 접근하기 어려웠다.
- 강화학습(RL)을 1조 매개변수 Mixture-of-Experts(MoE) 모델로 확장하는 과정에서 학습-추론 불일치로 인한 상당한 불안정성에 직면했다.
- 긴 추론 궤적을 처리하는 비효율성과 RL 인프라의 시스템적 병목이 전례 없는 규모에서 상당한 난제를 제기했다.
- Long Chain-of-Thought 지도 미세조정과 대규모 강화학습을 포함한 다단계 파이프라인으로 학습된 1조 매개변수 MoE 모델 Ring-1T를 개발했다.
- 확률 편차에 대한 양측 마스킹 보정을 통해 잡음이 있는 그래디언트 갱신을 억제함으로써 학습을 안정화하는 RL 알고리즘 변형 IcePop을 도입했다.
- 동적이고 예산 통제된 분할을 사용해 효율적인 궤적 처리를 위한 C3PO++를 설계하고, 1조 매개변수 규모에 맞춘 고성능 분산 RL 인프라 ASystem을 구축했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.