Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation

발행일
출처
arXiv
논문 번호
412
분야
Machine Learning
arXiv 번호
2606.13657

On-policy distillation(OPD)의 파라미터 업데이트가 sparse하고 off-principal한 기하학적 특성을 가짐을 분석했다. dense supervision에도 불구하고 OPD는 sparse on-policy editing에 더 가깝다.

On-policy distillation(OPD)이 모델 파라미터를 어떻게 변화시키는지를 희소성과 기하학 관점에서 분석했다. 10개 모델 페어(LLM+VLM) 실험 결과, OPD 업데이트는 작고 coordinate-sparse하며 FFN-heavy한 분포를 보인다. 발견된 subnetwork만 학습해도 전체 OPD 성능을 회복하지만, SGD는 AdamW에 못 미치는 것으로 나타났다. 기하학적으로는 수치적으로 full-rank이나 스펙트럼이 집중되어 있고, source weight의 주성분 방향이 아닌 저크기 좌표에 집중되는 특성을 보인다.

핵심 요약

  • OPD 업데이트는 작고 coordinate-sparse하며, 주로 FFN 층에 분포 (10개 모델 페어 일관성)
  • 발견된 sparse subnetwork만 학습해도 전체 OPD reasoning 성능 회복 가능
  • SGD는 AdamW에 못 미침 — sparse update라도 adaptive scaling이 필요 (gradient scale 이질성)
  • OPD delta는 수치적으로 full-rank이나 top-16 특이값 에너지가 ~20-30%로 스펙트럼 집중
  • 업데이트가 source weight의 principal direction을 회피하고 low-magnitude 좌표에 집중 — RLVR과 유사 패턴
  • Dense supervision이 있어도 OPD는 dense rewriting이 아닌 sparse on-policy editing에 가까움

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)