Training AI Co-Scientists Using Rubric Rewards
- 발행일
- 출처
- arXiv
- 논문 번호
- 103
- 분야
- Scientific AI / RL
- arXiv 번호
- 2512.23707
Meta Superintelligence Labs와 학술 기관의 연구진은 다양한 과학 분야에 걸쳐 고품질 연구 계획을 생성할 수 있는 'AI 공동 연구자'로 언어 모델을 학습시키는 확장 가능한 방법을 개발했다.
Meta Superintelligence Labs와 학술 기관의 연구진은 다양한 과학 분야에 걸쳐 고품질 연구 계획을 생성할 수 있는 'AI 공동 연구자'로 언어 모델을 학습시키는 확장 가능한 방법을 개발했다. 이 접근법은 과학 문헌에서 연구 목표와 채점 루브릭을 자동으로 추출하고 이를 자기 채점 강화학습 프레임워크와 결합하며, 그 결과 미세조정된 모델이 인간 전문가에게 70%의 비율로 선호되고 루브릭 만족 점수에서 10~15%의 상대적 향상을 보인다.
핵심 요약
- 기존의 과학용 AI 응용은 일반적으로 잘 정의되고 실행 가능한 환경에 국한되어, 추상적이고 개방형인 과학적 탐구에 대한 유용성이 제한적이다.
- 대규모 언어 모델(LLM)은 과학적 맥락에서 인간 피드백을 얻는 과정이 느리고, 비용이 많이 들며, 종종 모호하기 때문에 고품질의 장문 연구 계획을 생성하는 데 어려움을 겪는다.
- 개방형 과학 과제를 위한 고도의 전문성을 갖춘 학습 데이터와 피드백의 확보를 확장하는 것이 주요 병목이며, 인간 전문가가 수작업으로 주석을 다는 일은 비용과 시간이 많이 든다.
- ResearchPlanGen이라는 자동화 파이프라인을 구축하여 과학 논문에서 직접 연구 목표, 목표별 채점 루브릭, 참조 솔루션을 추출하고 크고 다양한 학습 데이터셋을 생성했다.
- 자기 채점 강화학습(RL) 프레임워크를 구현했으며, 여기서 초기 언어 모델의 동결된 복사본이 특권적인 목표별 루브릭과 일반 가이드라인을 사용하여 생성된 계획을 채점하는 '자동 채점자' 역할을 한다.
- 계획 생성 모델은 루브릭 만족 점수를 직접적인 보상 신호로 활용하여 Group Relative Policy Optimization(GRPO)으로 최적화했으며, 간결성을 강제하기 위한 길이 제어 전략도 함께 적용했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.