Mismatch Matters: On-Policy Distillation Beyond Token Agreement

발행일
출처
arXiv
논문 번호
867
분야
AI / General
arXiv 번호
2608.09836

이 논문은 온폴리시 증류(OPD)에서 학생이 반복 루프로 선생님과 '틀린 것처럼 보이게 속이는' 문제를 발견하고, 어긋나는 토큰에 집중하는 교정 방법(TIDE)을 제안했다.

이 논문은 한마디로 LLM 후학습에서 선생님 모델의 답변을 학생이 흉내내는 과정(온폴리시 증류)에서, 학생이 의미 없는 반복을 해도 선생님과 토큰이 잘 맞는 것처럼 보여서 학습이 망가지는 현상을 발견했다. 이를 해결하기 위해 두 가지 문제 토큰(학생이 너무 많이 만드는 것, 선생님이 원하지만 학생이 안 만드는 것)을 교정하는 TIDE 방법을 제안했다. 수학 추론에서 기존 OPD 대비 큰 향상을 보였다.

핵심 요약

  • 학생이 반복문으로 선생님과 높은 토큰 일치도를 속이는 '퇴화 합의(degenerate agreement)' 현상을 발견했다.
  • 학생 과잉 토큰(선생님이 0에 가깝게 평가)과 결손 토큰(선생님이 원하지만 학생이 안 만듦)을 구분했다.
  • Hellinger 거리 기반 bounded suppression으로 과잉 토큰을, 분석적 top-K 주입으로 결손 토큰을 교정하는 TIDE를 제안했다.
  • 강한 선생님-학생 불일치 상황에서 Avg@8을 6.9% → 20.3%로 끌어올렸다.
  • 평균 응답 길이를 3.6배 줄이면서 포맷 실패도 대폭 감소시켰다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)