Finetuning with Sampling: SFT Learns Better Than You Think
- 발행일
- 출처
- arXiv
- 논문 번호
- 1148
- 분야
- Machine Learning
- arXiv 번호
- 2610.02140
이 논문은 'SFT는 일반화가 약하다'는 통념을, 전문가 데이터를 모델 말투로 다시 샘플링해주는 방법으로 뒤집었다.
이 논문은 한마디로 강화학습 없이도 잘 다듬은 데이터만으로 SFT(지도 미세조정)가 RL급 성능을 낸다는 연구다. 전문가가 만든 답변 데이터를 MCMC 샘플링(기존 데이터를 모델이 자연스럽게 쓰는 표현으로 조금씩 바꾸는 기법)으로 변환해 모델 분포에 가깝게 만든 뒤 SFT했다. 화학·수학·의학 과제에서 일반 SFT보다 새로운 과제 성적이 더 높고, 기존 능력 잊는 폭도 -1.10%로 모든 기준보다 작았다. MCMC 단계를 늘릴수록 데이터가 모델에 더 가까워지고 정확도도 함께 올라갔다.
핵심 요약
- 전문가 답변을 MCMC 샘플링으로 모델이 쓰는 표현에 가깝게 바꾼 뒤 SFT하는 'projection sampling'을 제안했다.
- 화학 과제에서 일반 SFT는 MMLU 등 기존 능력을 크게 잃었지만, 이 방법은 평균 손실 -1.10%로 가장 적게 잊었다.
- MCMC 단계 수를 늘릴수록 학습 데이터가 모델 분포에 가까워지고 정확도도 함께 올라가, 샘플링 자체가 확장 가능한 계산 축이 됨을 보였다.
- 이 방법으로 학습한 모델은 베이스 모델이 전혀 못 풀던 문제를 67.2% 확률로 풀 정도로 진짜 새 능력을 익혔다.
- 샘플링 SFT로 초기화한 뒤 RL을 얹으면 MATH500 +40.7%, GSM8K +25.1%로 전체 최고 성적을 냈다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.