MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
- 발행일
- 출처
- arXiv
- 논문 번호
- 1181
- 분야
- LLMs / NLP
- arXiv 번호
- 2610.11959
이 논문은 대규모 강화학습(RL) 계산량을 과감히 늘려 에이전트 모델의 지능을 끌어올리는 방법을 Xiaomi MiMo-V2.6 시리즈로 보여준 기술 보고서다.
이 논문은 한마디로 RL 훈련에 들어가는 컴퓨팅 자원을 세 방향(배치 크기, 환경 다양성, 채점 정밀도)으로 크게 키우면 에이전트 성능이 코딩·보안·시각 작업 전반에서 꾸준히 오른다는 것을 증명한 보고서다. 1조 파라미터급 MoE(여러 전문가 모듈을 섞어 쓰는 구조) 모델을 만들고, 한 스텝에 최대 37억 토큰을 처리하며 100만 토큰 길이의 긴 대화도 소화한다. 테스트만 통과하면 똑같은 점수를 주던 방식 대신, 여러 답안을 서로 비교해 품질을 가려주는 그룹 채점을 도입해 더 유용한 학습 신호를 얻었다. 훈련 안정화를 위해 라우터(어떤 전문가 모듈을 쓸지 정하는 부분)를 얼리고 보상 조작(reward hacking)에 대한 다층 방어도 세웠다. 훈련 코드, 환경, 프레임워크를 전부 공개해 다른 연구자들이 재현할 수 있게 했다.
핵심 요약
- 한 스텝에 1,568개 샘플과 27~37억 토큰을 처리하는 비동기 훈련으로 최대 100만 토큰 길이의 긴 과제까지 다뤘다.
- 코딩, 일반 업무, 시각 작업, 사이버보안 4개 영역의 환경과 서로 다른 에이전트 하네스(실행 뼈대)를 섞어 써서 일반화 성능을 높였다.
- 테스트 통과 여부만 보던 이진 채점 대신, 그룹 내 답안끼리 비교하는 그룹 채점을 도입해 더 정밀한 보상 신호를 만들었다.
- MoE 라우터를 얼리고 보상 조작에 대한 다층 방어를 세워 대규모 RL 훈련이 무너지지 않게 유지했다.
- 훈련 동태, RL 환경, RL 프레임워크를 모두 오픈소스로 공개해 대규모 에이전트 RL 연구의 재현 기준점을 만들었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.