DOPD: Dual On-policy Distillation

발행일
출처
arXiv
논문 번호
526
분야
AI / General
arXiv 번호
2606.30626

온정책 증류(OPD)에서 특권 정보 도입 시 발생하는 'privilege illusion' 문제를 해결하는 dual distillation 패러다임을 제안한다.

DOPD는 온정책 증류에서 특권 정보(privileged information)를 도입할 때 발생하는 privilege illusion 현상을 해결하는 이중 증류 패러다임이다. 특권 정보가 포함된 교사와 학생 사이의 advantage gap을 토큰 단위로 평가하여, 능력 격차가 실제 존재하는 토큰은 교사 증류를, 그렇지 않은 토큰은 학생 자기 감독을 적용한다. LLM(Qwen3-8B→1.7B)과 VLM(Qwen3-VL-8B→2B) 설정에서 Vanilla OPD 대비 각각 7.5, 6.0점 향상을 달성했으며, 지속 학습·OOD 일반화·훈련 안정성에서도 일관된 우위를 보였다.

핵심 요약

  • Privilege illusion: 특권 정보로 인한 정보 비대칭이 능력 격차와 혼동되는 실패 패턴 정의
  • Advantage-aware routing: 토큰별로 교사/학생 감독 소스를 동적 선택
  • LLM에서 Vanilla OPD 대비 +7.5점, VLM에서 +6.0점 평균 향상
  • 강한 교사 증류(전 어휘)와 약한 학생 자기 감독을 토큰 카테고리별 적용
  • 지속 학습, OOD 일반화, 훈련 안정성에서 일관된 우위 검증
  • 토큰 수준 분석: high-teacher/low-student 토큰이 핵심 능력 전달 담당

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)