Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 238
- 분야
- Machine Learning
- arXiv 번호
- 2605.22731
이 연구는 손실 함수만이 아니라 지도가 적용되는 상태 분포를 강조하여 대규모 언어 모델 사후학습 방법을 재해석한다.
이 논문은 대규모 언어 모델의 사후학습을 토큰 손실뿐 아니라 감독이 적용되는 상태 분포의 관점에서 설명한다. 여기서 상태는 프롬프트와 지금까지 생성한 접두사이며, SFT는 고정 데이터의 상태를 쓰는 반면 강화학습과 온-폴리시 증류는 현재 학습자가 만든 상태를 사용한다. Qwen3-0.6B-Base를 GSM8K에 학습하고 TruthfulQA와 MMLU로 능력 보존을 확인하는 통제 실험을 수행했다. 약한 SFT는 망각이 적었지만 강한 SFT는 보존 성능을 크게 잃었고, 온-폴리시 증류는 성능이 낮아진 교사를 감독 원천으로 쓰고도 그 교사보다 세 평가에서 더 나았으며 강화학습도 보존 손실이 작았다. 결과는 감독 신호의 형태만큼 학습 상태의 출처와 학습자 주변에서의 국소성이 중요함을 보이지만, 단일 소형 모델과 제한된 과제에서 얻은 초기 증거라는 범위는 남는다.
핵심 요약
- SFT는 본질적으로 파괴적이지는 않지만, off-policy 특성 때문에 높은 압력 하에서는 위험해진다. 개발자는 데이터셋 분포와 모델의 자연스러운 분포 간 정렬을 모니터링해야 한다.
- On-policy 학습은 안정화 장치다. RL이든 증류든, 학습자 자신의 분포에서 샘플링하면 업데이트가 적절성을 갖도록 보장하고 off-policy 방법보다 모델 본래의 능력을 더 잘 보존한다.
- 증류는 단순 복제 이상이다. 상태를 신호로부터 분리함으로써, on-policy 증류는 지도가 충분히 조밀하다면(단일 토큰 로짓이 아니라 연속을 사용한다면) 학생이 교사의 한계를 뛰어넘을 수 있게 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.