Rethinking On-Policy Distillation of Large Language Models II: One Training Example

발행일
출처
arXiv
논문 번호
1066
분야
AI / General
arXiv 번호
2609.04172

증류 훈련에 쓰는 질문이 딱 1개여도 수백 스텝씩 계속 성능이 오르고 전체 데이터 효과의 72%를 회복한다는 사실을 보여주고 그 이유를 밝힌 논문이다.

이 논문은 한마디로 온폴리시 증류(학생이 스스로 답을 써 보면 선생 모델이 토큰 하나하나 피드백을 주는 학습법)가 훈련 질문 1개만으로도 풀데이터 효과의 대부분을 낸다는 발견과 그 이유를 밝힌 연구다. 저자들은 '상태 커버리지(학생이 실제로 거쳐 가는 상태가 전체에서 차지하는 비율)'로 설명하는데, 질문 1개만으로도 71.5%를 덮고 의미가 다른 질문 16개면 98.9%를 덮어 전체 데이터와 동급이 된다. 반면 학생이 선생과의 격차를 메우는 속도는 질문 수와 무관하게 비슷하게 떨어진다. 즉 데이터는 남아돌고 알고리즘이 소화를 못 하는 '데이터 과잉, 알고리즘 기근' 상태라는 게 결론이다.

핵심 요약

  • 증류 훈련에 질문 1개만 써도 수백 스텝 동안 성능이 계속 올라가, 수학 과제에서 전체 데이터 효과의 72%를 회복했다.
  • '상태 커버리지'라는 잣대를 제안해 설명했다. 질문 1개 = 71.5%, 의미가 다른 질문 16개 = 98.9% 커버로 전체 데이터 훈련과 동급 성적을 냈다.
  • 흡수율(남은 선생-학생 격차 중 한 번의 업데이트로 메우는 비율)은 질문 1개든 17,000개든 비슷한 속도로 떨어졌다. 병목은 데이터 양이 아니라 학습 알고리즘이라는 뜻이다.
  • 내용이 거의 없는 템플릿이나 관계없는 도메인의 잡담 데이터(WildChat)로 훈련해도 진짜 질문과 비슷한 효과가 났다. 질문의 역할은 '생각을 시작시키는 것'뿐이라는 것이다.
  • 같은 질문 하나로 1000스텝을 비교하면 증류(OPD)의 성능 향상은 강화학습(RLVR)의 2배 이상이었다. 결과 보상은 답을 맞히면 소진되지만 토큰 단위 지도는 계속 남기 때문이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)