Distilled Reinforcement Learning for LLM Post-training
- 발행일
- 출처
- arXiv
- 논문 번호
- 676
- 분야
- Machine Learning
- arXiv 번호
- 2607.17247
교사 모델의 선호를 강화학습 목적함수 안에 직접 섞어 넣어, 기존 강화학습과 온폴리시 증류의 약점을 동시에 푼 사후학습 방법이다.
대형언어모델 사후학습(post-training, 사전학습 뒤 성능을 다듬는 단계)의 두 갈래인 강화학습과 온폴리시 증류는 각각 약점이 있다. 강화학습은 응답 전체에 하나의 보상만 주어 어느 토큰이 잘했는지 가리기 어렵고, 새 지식을 못 배운다. 온폴리시 증류는 교사 분포를 무조건 따라해서, 비슷한 교사는 줄 게 없고 많이 다른 교사는 오히려 방해가 된다. 저자들은 Distilled RL을 제안해, 교사와 옛 학생 정책 사이의 역방향 중요도 비율로 강화학습 신호를 토큰 단위로 재분배하고, 음의 이득 응답에는 교사 가중치를 끄고, 응답 단위 기하평균 정규화로 길이에 따른 신호 약화를 없앴다. 같은 계열과 다른 계열 증류 모두에서 강화학습, 온폴리시 증류, 둘의 단순 결합보다 pass@1과 pass@k가 일관되게 높았다.
핵심 요약
- 강화학습은 응답 하나에 보상 하나만 주기 때문에 어느 중간 추론 단계를 칭찬할지 가리기 어렵고, 학생이 이미 할 수 있는 행동을 강화할 뿐 새 지식을 넣지는 못한다.
- 온폴리시 증류는 KL 발산으로 교사 분포를 무조건 따라하게 만들어, 교사가 너무 비슷하면 배울 게 없고 계열이 다르면 잡음이 커지는 딜레마에 빠진다.
- Distilled RL은 별도의 모방 목적을 두지 않고, 교사 정책과 옛 학생 정책의 역방향 중요도 비율로 강화학습의 학습 신호 자체를 토큰별로 다시 나눈다.
- 세 부품으로 구성한다. 비율 잘라내기가 붙은 역방향 중요도 샘플링, 이득이 음수인 응답에는 가중치를 1로 되돌리는 음성 표본 리셋, 응답 안 비율들의 기하평균을 1로 맞추는 응답 단위 기하 정규화다.
- 음성 표본 리셋을 빼면 평균 pass@1이 Qwen3-4B에서 8.81점, DSQW-1.5B에서 6.39점 떨어져 세 부품 중 가장 중요했다.
- 특히 교사와 학생의 계열이 다른 상황에서 이점이 컸다. 이 조건에서 온폴리시 증류는 강화학습보다 계속 뒤처졌지만 Distilled RL은 모든 기준선을 앞섰다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.