Base Models Can Reason By Taking a Cue From Training Data
- 발행일
- 출처
- arXiv
- 논문 번호
- 1166
- 분야
- Machine Learning
- arXiv 번호
- 2610.06851
이 논문은 기본 언어모델의 첫 두 토큰만 강제로 고정하면 RL로 학습시킨 모델급 추론 성능이 나온다는 것을 보였다.
이 논문은 한마디로 "응답의 첫 두 토큰만 잘 정해주면 기본 모델도 추론을 한다"는 발견이다. 예를 들어 ". Okay"라는 시작 토큰을 고정하니 Olmo-3-7B의 MATH-500 점수가 42%에서 78%로 뛰었다. 연구진은 이 효과가 훈련 데이터 속 토큰 연관(조건반사처럼 학습된 연결)에서 온다는 걸 데이터를 직접 수정해 증명했다. RL 학습이 결국 이런 큐를 더 자주 내보내도록 만드는 것임도 밝혔다.
핵심 요약
- 첫 두 토큰 큐만 고정해도 Olmo-3-7B의 MATH-500 정확도가 42%에서 78%로 올라갔다 (RL 버전은 75%).
- RL 학습은 새 능력을 가르친다기보다, 기존 추론 큐가 나올 확률을 높이는 쪽에 가깝다는 걸 보였다.
- 훈련 데이터에서 "okay"를 "chicken"으로 바꾸면 "chicken"이 추론 큐가 되는 등, 큐 효과가 데이터에서 온다는 걸 인과적으로 증명했다.
- 안전 사례 연구에서는 큐마다 거절/순응 행동이 달라져, 안전 평가 방식에도 시사점을 준다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.