Training AI Scientists to Replicate Research
- 발행일
- 출처
- arXiv
- 논문 번호
- 905
- 분야
- Machine Learning
- arXiv 번호
- 2608.13331
논문 그림 복제 과제 모음(Replica)으로 27B 에이전트 Faraday를 강화학습시켜, Claude·GPT급 코딩 에이전트를 '도구'로 부리면서도 복제 품질은 앞서게 만든 'AI 과학자' 훈련 논문.
이 논문은 한마디로 AI에게 논문의 그림을 실제 실험으로 재현(복제)시키는 훈련법을 제안해, 270억 파라미터(27B) 모델이 최고급 상용 모델을 이기게 만든 연구다. 연구진은 100편 논문에서 결과 그림을 가려버린 310개 복제 과제(Replica)를 만들고, 채점 기준표(루브릭)를 자동 생성하는 심판 모델이 사람 전문가 평가와 잘 맞는다는 것을 검증해 보상 신호로 썼다. 여기에 코딩 에이전트를 도구로 부리는 방식(CAT)으로 GRPO 강화학습을 시킨 결과, 27B 모델 Faraday는 처음 보는 과제에서 Claude Opus 4.8을 60% 이기고 평균 +6~8% 앞섰다. Faraday는 그림을 찍어내는 대신 논문의 원리를 직접 구현하는 등 인간 과학자에 가까운 행동을 보였고, 작은 모델이 큰 모델을 감독·활용한다는 점에서 AI 안전성 관점에서도 의미가 크다.
핵심 요약
- 27B 소형 모델(Faraday)이 5조 파라미터급 코딩 에이전트를 도구로 부려 논문 복제에서 Claude/GPT급을 능가했다 — 큰 모델을 곧바로 쓰는 것보다 작은 모델에 '과학적 판단력'을 심는 쪽이 낫다는 뜻.
- 검증 불가능한 열린 과제에도, 사람 평가와 일치하는 자동 루브릭 심판을 보상으로 쓰면 안정적으로 강화학습이 된다는 레시피를 제시했다.
- 미학습(홀드아웃) AI-for-science 과제에서도 60% 승률과 평균 +6% — 단순 암기가 아니라 과학적 사고가 이식됐다.
- Faraday는 결과를 코딩으로 찍어내는 대신 논문의 메커니즘을 직접 구현하고 실험 규모를 예산에 맞게 축소하는, 인간 과학자 같은 태도를 보였다.
- 약한 모델이 강한 모델을 감독·지휘하는 구조가 실제 성능으로 이어져, AI 안전성(감독 가능성) 연구에도 중요한 증거가 됐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.