Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
- 발행일
- 출처
- arXiv
- 논문 번호
- 768
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.28568
AI가 AI를 개선하는 과정(재귀적 자기개선)을 머신러닝 엔지니어링에서 실현한 모델. 35B 크기로 GPT-5.5를 넘어서는 성능을 보였다.
이 논문은 한마디로 AI 스스로가 머신러닝 코드를 작성하고 실험을 반복해서 성능을 높이는 '메타 진화 에이전트'를 만들었다는 이야기다. 핵심은 초안 작성, 개선, 디버깇, 교차(유전)라는 네 가지 기본 동작을 학습시키고, 이를 긴 시간 진화 탐색에 활용하는 것이다. MLE-Bench Lite에서 기존 39.4%에서 71.2%로 크게 향상되었으며, GPT-5.5+Codex를 넘어 Kimi K3 수준에 근접했다. 모델 가중치와 전체 시스템을 오픈소스로 공개했다.
핵심 요약
- AI4AI(AI로 AI 개선)를 위해 OpenMLE라는 전체 스택 시스템을 구축하고 5,758개의 실행 가능한 작업 환경을 만들었다.
- 초안 작성·개선·디버깇·교차 네 가지 진화 연산자를 RL로 학습시켜 메타 진화 에이전트 Frontis-MA1-35B를 훈련했다.
- MLE-Bench Lite에서 메달 평균 39.4%에서 71.2%로 향상했고, GPT-5.5+Codex(68.2%)를 능가했다.
- 별도 벤치마크 NatureBench Lite에서도 전이 학습 효과가 확인되어, 단순 벤치마크 암기가 아님을 증명했다.
- 모델 가중치, 작업 환경, 훈련 코드를 모두 공개하여 재귀적 자기개선 연구의 재현 가능한 기반을 제공했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.