Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

발행일
출처
arXiv
논문 번호
768
분야
LLMs / NLP
arXiv 번호
2607.28568

AI가 AI를 개선하는 과정(재귀적 자기개선)을 머신러닝 엔지니어링에서 실현한 모델. 35B 크기로 GPT-5.5를 넘어서는 성능을 보였다.

이 논문은 한마디로 AI 스스로가 머신러닝 코드를 작성하고 실험을 반복해서 성능을 높이는 '메타 진화 에이전트'를 만들었다는 이야기다. 핵심은 초안 작성, 개선, 디버깇, 교차(유전)라는 네 가지 기본 동작을 학습시키고, 이를 긴 시간 진화 탐색에 활용하는 것이다. MLE-Bench Lite에서 기존 39.4%에서 71.2%로 크게 향상되었으며, GPT-5.5+Codex를 넘어 Kimi K3 수준에 근접했다. 모델 가중치와 전체 시스템을 오픈소스로 공개했다.

핵심 요약

  • AI4AI(AI로 AI 개선)를 위해 OpenMLE라는 전체 스택 시스템을 구축하고 5,758개의 실행 가능한 작업 환경을 만들었다.
  • 초안 작성·개선·디버깇·교차 네 가지 진화 연산자를 RL로 학습시켜 메타 진화 에이전트 Frontis-MA1-35B를 훈련했다.
  • MLE-Bench Lite에서 메달 평균 39.4%에서 71.2%로 향상했고, GPT-5.5+Codex(68.2%)를 능가했다.
  • 별도 벤치마크 NatureBench Lite에서도 전이 학습 효과가 확인되어, 단순 벤치마크 암기가 아님을 증명했다.
  • 모델 가중치, 작업 환경, 훈련 코드를 모두 공개하여 재귀적 자기개선 연구의 재현 가능한 기반을 제공했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)