PaperGym: Rubric-Centered Evolution for Research-Plan Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 1055
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.31119
논문 2만 편을 '연구 계획 훈련 환경'으로 바꿔, 정답 검증이 불가능한 연구 기획에도 강화학습을 걸 수 있게 만든 프레임워크다.
이 논문은 한마디로 '연구 계획서에는 정답이 없어서 강화학습을 못 시킨다'는 고민을, 논문 자체를 채점 기준(rubric)으로 바꿔 해결했다. 질문은 논문의 목표·배경에서, 채점 기준은 방법·실험에서 따와 '질문을 바꿔 말하기만 해도 점수를 따는' 누출 꼼수를 3.7%까지 막았다. 루브릭을 자가 증류 교사의 힌트로, 이어 GRPO의 보상으로 두 번 활용하는 2단계 학습을 돌렸더니 Qwen3-8B가 ResearchQA 73.48로 거대 모델 Kimi K2.6(73.19)을 넘었다.
핵심 요약
- 논문 구조를 이용해 질문(목표·배경)과 채점 기준(방법·실험)의 출처를 분리, 기준 누출률을 기존 11.9~34.1%에서 3.7%로 낮췄다.
- 같은 루브릭을 OPSD 자가교사의 특권 컨텍스트로, 그다음 GRPO 보상으로 두 번 쓰는 2단계 학습이 SFT·단독·역순을 모두 이겼다.
- Qwen3-1.7B/4B/8B에서 5개 벤치마크 평균을 각각 +5.6, +5.0, +4.8점 올렸다.
- 학습 레시피를 고정한 대조에서 PaperGym-20k 학습 모델이 3자 비교 승률 58.1%로 RubricHub Science(28.2%)를 압도해 데이터 품질의 효과를 분리해 보였다.
- 훈련된 Qwen3-8B가 ResearchQA 73.48로 훨씬 큰 Kimi K2.6(73.19)을 넘었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.