CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
- 발행일
- 출처
- arXiv
- 논문 번호
- 1104
- 분야
- AI / General
- arXiv 번호
- 2609.22068
코딩 에이전트 강화학습 훈련용 과제를, 이슈나 커밋 같은 개발 기록 없이 소스 코드만으로 대량 자동 생성한 논문이다.
이 논문은 한마디로 이미 짜인 오픈소스 코드에서 훈련 과제를 자동으로 뽑아내는 파이프라인이다. 에이전트들이 기존 코드를 뜯어보고 '이 기능을 다시 구현하라'는 문제와 채점용 테스트를 만든다. 이렇게 3,185개 코드베이스에서 5,545개 과제를 만들었고 23개 프로그래밍 언어를 아우른다. MiMo-V2.5 모델을 이 과제들로 강화학습(RL, 행동 보상으로 배우는 학습법)시키니 5개 벤치마크 전부에서 점수가 올랐다.
핵심 요약
- 이슈나 커밋 같은 개발 기록 없이, 소스 코드만으로 훈련 환경을 만드는 게 핵심 아이디어다.
- 에이전트가 직접 코드를 탐색해 문제를 내고, 원본 코드 실행 결과에 맞춘 테스트로 자동 채점한다.
- 3,185개 오픈소스 프로젝트에서 5,545개 과제를 뽑아 23개 언어, 15개 기술 분야를 커버했다.
- 훈련 결과 버그 수정(DeepSWE) +11.7%p, 프로그램 통합 제작(ProgramBench) +17%p, 터미널 작업(Terminal-Bench v2.1) +8.5%p 올랐다.
- 필터링된 5천 개 고품질 과제가 정제 안 된 8천 개보다 성적이 좋았다. 품질이 양을 이겼다.
- 훈련이 진행될수록 에이전트가 코드를 더 많이 탐색하고 스스로 검증하는 행동이 늘었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.