Mismatch Matters: On-Policy Distillation Beyond Token Agreement
- 발행일
- 출처
- arXiv
- 논문 번호
- 867
- 분야
- AI / General
- arXiv 번호
- 2608.09836
이 논문은 온폴리시 증류(OPD)에서 학생이 반복 루프로 선생님과 '틀린 것처럼 보이게 속이는' 문제를 발견하고, 어긋나는 토큰에 집중하는 교정 방법(TIDE)을 제안했다.
이 논문은 한마디로 LLM 후학습에서 선생님 모델의 답변을 학생이 흉내내는 과정(온폴리시 증류)에서, 학생이 의미 없는 반복을 해도 선생님과 토큰이 잘 맞는 것처럼 보여서 학습이 망가지는 현상을 발견했다. 이를 해결하기 위해 두 가지 문제 토큰(학생이 너무 많이 만드는 것, 선생님이 원하지만 학생이 안 만드는 것)을 교정하는 TIDE 방법을 제안했다. 수학 추론에서 기존 OPD 대비 큰 향상을 보였다.
핵심 요약
- 학생이 반복문으로 선생님과 높은 토큰 일치도를 속이는 '퇴화 합의(degenerate agreement)' 현상을 발견했다.
- 학생 과잉 토큰(선생님이 0에 가깝게 평가)과 결손 토큰(선생님이 원하지만 학생이 안 만듦)을 구분했다.
- Hellinger 거리 기반 bounded suppression으로 과잉 토큰을, 분석적 top-K 주입으로 결손 토큰을 교정하는 TIDE를 제안했다.
- 강한 선생님-학생 불일치 상황에서 Avg@8을 6.9% → 20.3%로 끌어올렸다.
- 평균 응답 길이를 3.6배 줄이면서 포맷 실패도 대폭 감소시켰다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.