Base Models Can Reason By Taking a Cue From Training Data

발행일
출처
arXiv
논문 번호
1166
분야
Machine Learning
arXiv 번호
2610.06851

이 논문은 기본 언어모델의 첫 두 토큰만 강제로 고정하면 RL로 학습시킨 모델급 추론 성능이 나온다는 것을 보였다.

이 논문은 한마디로 "응답의 첫 두 토큰만 잘 정해주면 기본 모델도 추론을 한다"는 발견이다. 예를 들어 ". Okay"라는 시작 토큰을 고정하니 Olmo-3-7B의 MATH-500 점수가 42%에서 78%로 뛰었다. 연구진은 이 효과가 훈련 데이터 속 토큰 연관(조건반사처럼 학습된 연결)에서 온다는 걸 데이터를 직접 수정해 증명했다. RL 학습이 결국 이런 큐를 더 자주 내보내도록 만드는 것임도 밝혔다.

핵심 요약

  • 첫 두 토큰 큐만 고정해도 Olmo-3-7B의 MATH-500 정확도가 42%에서 78%로 올라갔다 (RL 버전은 75%).
  • RL 학습은 새 능력을 가르친다기보다, 기존 추론 큐가 나올 확률을 높이는 쪽에 가깝다는 걸 보였다.
  • 훈련 데이터에서 "okay"를 "chicken"으로 바꾸면 "chicken"이 추론 큐가 되는 등, 큐 효과가 데이터에서 온다는 걸 인과적으로 증명했다.
  • 안전 사례 연구에서는 큐마다 거절/순응 행동이 달라져, 안전 평가 방식에도 시사점을 준다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)