On the Geometry of On-Policy Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 363
- 분야
- Machine Learning
- arXiv 번호
- 2606.07082
온정책 증류(OPD)가 SFT와 RLVR 사이의 단순한 중간점이 아니라, 고유한 파라미터 공간 기하학을 형성한다는 것을 처음으로 규명한 연구다.
On-policy distillation(OPD)의 파라미터 공간 훈련 역학을 SFT 및 RLVR과 비교 분석했다. OPD는 SFT보다 적은 가중치를 업데이트하고 주성분 방향을 더 강하게 회피하는 relaxed off-principal regime에 위치하며, 훈련 초기에 저차원 서브스페이스에 락인되는 subspace locking 현상을 보인다. 이 서브스페이스는 기능적으로 충분하여 랭크-16 제약을 걸어도 OPD 성능이 유지되지만 SFT는 크게 저하된다. 목적 함수 구성(objective composition)이 서브스페이스 락을 제어하는 핵심 요인임을 확인했다.
핵심 요약
- OPD는 SFT(주성분 정렬)와 RLVR(비주성분 국소화) 사이의 완화된 비주성분 체제(relaxed off-principal regime)에 위치한다
- 훈련 시작 직후 업데이트가 좁은 저차원 채널에 락인되는 subspace locking 현상을 발견했다
- 랭크-16 투영 제약 하에서 OPD는 성능을 유지하지만 SFT는 크게 저하되어 락인된 서브스페이스가 기능적으로 충분함을 입증했다
- 토큰 희소화와 오프정책 롤아웃은 랭크 궤적을 보존하지만 목적 함수 혼합은 궤적을 변화시켜 목적 함수 구성이 핵심 제어 축임을 확인했다
- Qwen3-8B 기반 제어 실험에서 업데이트 희소성, 스펙트럼 드리프트, 주성분 회전 등 다차원 진단 지표를 활용했다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.