Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers
- 발행일
- 출처
- arXiv
- 논문 번호
- 406
- 분야
- Machine Learning
- arXiv 번호
- 2606.12507
루브릭 기반 RL 훈련에서 외부 LLM 판정기를 제거한 RGSD(루브릭 안내 자기증류) 방법. 루브릭을 조건으로 받은 teacher 모델이 unconditioned student를 토큰 단위로 증류하며, 4개 모델·2개 도메인에서 GRPO와 동등한 성능을 판정기 호출 없이 달성했다.
RGSD는 개방형 도메인에서 루브릭 기반 훈련의 비용과 편향 문제를 해결하는 verifier-free 방법이다. 핵심 관찰은 베이스 모델에 루브릭을 컨텍스트로 주면 30-45점 향상이 있다는 것. RGSD는 이 루브릭-조건부 모델을 teacher로 삼고, prompt-only student의 온폴리시 롤아웃을 토큰 단위로 증류한다. Qwen-2.5(3B, 7B)와 Qwen3-Thinking(4B, 8B)에서 의료/과학 도메인으로 평가해 judge-based GRPO와 동등한 성능을, 판정기 호출 없이 단일 롤아웃만으로 달성했다.
핵심 요약
- 핵심 아이디어: 루브릭-조건부 teacher를 unconditioned student에 토큰 단위 자기 증류
- 루브릭 조건만으로 베이스 모델 성능이 30-45pp 향상하는 '조건 향상 효과'를 활용
- GRPO 대비 의료 +6.1 vs +5.9pp, 과학 +4.9 vs +4.5pp로 동등하면서 판정기 호출 제로
- Qwen-2.5-7B에서 GRPO 대비 응답 길이가 약 절반으로 단축되며 verbosity drift 방지
- clipped Jensen-Shannon divergence로 온폴리시 student 롤아웃 증류
- 더 강한 판정기를 쓰는 GRPO가 일부 설정에서 RGSD를 능가할 수 있어 보완적 관계
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.