On the Geometry of On-Policy Distillation

발행일
출처
arXiv
논문 번호
363
분야
Machine Learning
arXiv 번호
2606.07082

온정책 증류(OPD)가 SFT와 RLVR 사이의 단순한 중간점이 아니라, 고유한 파라미터 공간 기하학을 형성한다는 것을 처음으로 규명한 연구다.

On-policy distillation(OPD)의 파라미터 공간 훈련 역학을 SFT 및 RLVR과 비교 분석했다. OPD는 SFT보다 적은 가중치를 업데이트하고 주성분 방향을 더 강하게 회피하는 relaxed off-principal regime에 위치하며, 훈련 초기에 저차원 서브스페이스에 락인되는 subspace locking 현상을 보인다. 이 서브스페이스는 기능적으로 충분하여 랭크-16 제약을 걸어도 OPD 성능이 유지되지만 SFT는 크게 저하된다. 목적 함수 구성(objective composition)이 서브스페이스 락을 제어하는 핵심 요인임을 확인했다.

핵심 요약

  • OPD는 SFT(주성분 정렬)와 RLVR(비주성분 국소화) 사이의 완화된 비주성분 체제(relaxed off-principal regime)에 위치한다
  • 훈련 시작 직후 업데이트가 좁은 저차원 채널에 락인되는 subspace locking 현상을 발견했다
  • 랭크-16 투영 제약 하에서 OPD는 성능을 유지하지만 SFT는 크게 저하되어 락인된 서브스페이스가 기능적으로 충분함을 입증했다
  • 토큰 희소화와 오프정책 롤아웃은 랭크 궤적을 보존하지만 목적 함수 혼합은 궤적을 변화시켜 목적 함수 구성이 핵심 제어 축임을 확인했다
  • Qwen3-8B 기반 제어 실험에서 업데이트 희소성, 스펙트럼 드리프트, 주성분 회전 등 다차원 진단 지표를 활용했다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)