Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 939
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.16647
같은 기반 모델에서 갈라진 교사의 풀이 행동은 넓게 옮겨지지만, 여러 교사는 학생의 여러 능력을 서로 자기 쪽으로 끌어당긴다는 연구다.
이 논문은 한마디로 학생이 직접 만든 답에 교사가 토큰별 지도를 주는 온폴리시 증류가 어디까지 일반화되는지 조사한다. 수학 문제에서는 교사가 항상 맞히는 문제와 전혀 못 푸는 문제로 학습해도 최종 성능이 거의 같아, 정답 암기보다 풀이 행동이 옮겨진다고 해석한다. 같은 기반 모델에서 나온 교사와 학생 조합은 중국어, 긴 추론과 다른 분야까지 교사 수준에 가까워졌지만, 기반이 다른 조합은 주로 학습한 분포에서만 좋아졌다. 이런 넓은 전이는 여러 교사를 섞을 때 장점만 되지 않았다. 교사별 자료 비율이 바뀌면 여러 분야의 능력이 배정된 분야와 무관하게 한 교사 쪽으로 함께 움직였다.
핵심 요약
- 온폴리시 증류는 학생이 생성한 답의 각 시점에서 교사와 학생의 다음 토큰 분포 차이를 줄인다. 학습 때부터 학생이 실제로 방문하는 문맥에서 지도를 받는 방식이다.
- BigMath에서 교사가 4회 모두 맞힌 문제, 모두 틀린 문제와 무작위 문제를 각각 2만 5천 개씩 뽑았다. 여러 교사와 학생 조합에서 세 집단의 최종 수학 정확도는 거의 같았다.
- 같은 기반 모델에서 갈라진 교사는 영어 단기 수학으로만 가르쳐도 중국어, 장기 수학, 코드와 과학에서 학생을 교사 수준에 가깝게 끌어올렸다. 기반이 다른 교사는 더 강해도 이런 넓은 전이가 약했다.
- 교사 둘의 자료 비율을 바꾸자 학생의 여러 분야 점수가 더 많이 사용한 교사의 원래 능력 쪽으로 함께 움직였다. 첫 교사 배치에서 BeyondAIME와 OlymMATH 평균은 혼합 조건에 따라 25.1퍼센트에서 27.1퍼센트로 달라졌다.
- 실험은 수학, 코드, 과학과 지시 수행 모델에 한정되고 다중 교사 실험도 교사 2명과 고정된 분야 기반 라우팅만 다뤘다. 교사의 원치 않는 행동도 다른 분야로 퍼질 수 있어, 분야별 분배를 안전 경계로 보면 안 된다고 지적한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.