Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 412
- 분야
- Machine Learning
- arXiv 번호
- 2606.13657
On-policy distillation(OPD)의 파라미터 업데이트가 sparse하고 off-principal한 기하학적 특성을 가짐을 분석했다. dense supervision에도 불구하고 OPD는 sparse on-policy editing에 더 가깝다.
On-policy distillation(OPD)이 모델 파라미터를 어떻게 변화시키는지를 희소성과 기하학 관점에서 분석했다. 10개 모델 페어(LLM+VLM) 실험 결과, OPD 업데이트는 작고 coordinate-sparse하며 FFN-heavy한 분포를 보인다. 발견된 subnetwork만 학습해도 전체 OPD 성능을 회복하지만, SGD는 AdamW에 못 미치는 것으로 나타났다. 기하학적으로는 수치적으로 full-rank이나 스펙트럼이 집중되어 있고, source weight의 주성분 방향이 아닌 저크기 좌표에 집중되는 특성을 보인다.
핵심 요약
- OPD 업데이트는 작고 coordinate-sparse하며, 주로 FFN 층에 분포 (10개 모델 페어 일관성)
- 발견된 sparse subnetwork만 학습해도 전체 OPD reasoning 성능 회복 가능
- SGD는 AdamW에 못 미침 — sparse update라도 adaptive scaling이 필요 (gradient scale 이질성)
- OPD delta는 수치적으로 full-rank이나 top-16 특이값 에너지가 ~20-30%로 스펙트럼 집중
- 업데이트가 source weight의 principal direction을 회피하고 low-magnitude 좌표에 집중 — RLVR과 유사 패턴
- Dense supervision이 있어도 OPD는 dense rewriting이 아닌 sparse on-policy editing에 가까움
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.