Self-Policy Distillation via Capability-Selective Subspace Projection
- 발행일
- 출처
- arXiv
- 논문 번호
- 224
- 분야
- LLMs / NLP
- arXiv 번호
- 2605.22675
자기 정책 증류(SPD) 프레임워크는 중간 표현을 추출하여 능력별 부분공간에 투영하는 새로운 방법을 활용함으로써, 외부 신호 없이 자기 증류를 통해 대형 언어 모델이 스스로 향상되도록 한다.
Self-Policy Distillation은 외부 교사나 보상 및 실행 검증 없이 모델이 자신의 생성 결과로 특정 능력을 개선하는 자기 증류 방법이다. 정답을 결정하는 토큰의 기울기에서 저랭크 능력 부분공간을 추출하고, 자기 생성 중 키-값 활성화를 그 공간에 투영해 필요한 신호를 강조한다. 투영 훅으로 만든 원시 응답을 수집한 뒤 훅을 제거하고 원래 모델을 표준 다음 토큰 예측 손실로 미세조정한다. 코드 생성, 수학 추론, 객관식 질의응답 실험에서 기존 외부 신호 없는 자기 증류보다 최대 13%, 사전학습 기준보다 최대 16% 개선했으며 분포 밖 설정에서도 15% 높은 성능을 보고했다. 다만 세 능력 영역과 몇 가지 백본에서만 검증됐으므로 더 다양하고 안전이 중요한 과제에서의 효과는 아직 확인이 필요하다.
핵심 요약
- 독립성: 외부 교사나 보상 모델이 필요하지 않다.
- 일반화 가능성: 이질적인 도메인 전반에서 작동하며 과제 간에 전이된다.
- 선택성: 표면적 패턴이 아니라 그 기저의 능력 신호를 표적으로 삼는다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.