Pass the Baton: Trajectory-Relayed On-Policy Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 750
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.26057
이 논문은 학생 모델이 추론 중 잘못된 방향으로 가면 교사 모델이 잠깐 대신 생성하다가 다시 학생에게 넘기는 '바통 터치' 증류 방법을 제안한 연구다.
이 논문은 한마디로 온폴리시 증류(OPD)에서 학생이 추론을 잘못 시작할 때 교사가 잠깐 개입해 방향을 잡아주는 '릴레이' 방법을 제안했다. 핵심은 교사와 학생의 행동 차이가 큰 지점(핸드오프 트리거)을 라벨 없이 감지해서, 교사가 짧게 대신 생성한 뒤 학생이 이어서 하도록 하는 것이다. Qwen3 모델로 8개 수학 벤치마크에서 테스트해 표준 OPD 대비 +5.73%, 최강 기준선 대비 +1.49% 향상을 달성했다. 훈련 궤적 길이도 50% 이상 줄었다.
핵심 요약
- 교사-학생 간 '방향 전환 비대칭성'을 발견했다 — 교사는 반성하고 방향을 바꾸지만, 학생은 그냥 직진한다.
- 교사 토큰이 전체의 0.35%만 있어도 정확도가 +7.23%p 오르는 것을 실험으로 확인했다.
- 릴레이 예산으로 교사 개입 횟수와 길이를 제한해서 학생 정책에서 너무 멀어지지 않게 했다.
- 평균 훈련 궤적 길이를 50% 이상 단축(4658→2296 토큰)하면서도 정확도는 더 높았다.
- 단일 회귀 목적 함수로 VSD/GAN 손실 없이 안정적 훈련이 가능하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.