Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 870
- 분야
- Machine Learning
- arXiv 번호
- 2608.09228
이 논문은 온폴리시 자기 증류(OPSD)의 성공이 '선생님이 정답을 알아서'가 아니라 '선생님 컨텍스트 자체의 행동 유도 효과' 때문일 수 있음을 실험으로 보였다.
이 논문은 한마디로 '선생님 모델에 정답을 보여줘서 학생을 가르친다'는 통설을 의심했다. 정답 대신 아예 다른 문제의 풀이를 선생님 컨텍스트에 넣어도(OP2SD) 비슷한 성능 향상이 나왔다. 이는 OPSD의 이득이 정답 전달이 아니라 '선생님이 수학 풀이 컨텍스트에 있을 때 만드는 분포 변화' 때문일 수 있다는 것을 시사한다. 다만 물리 문제를 넣으면 효과가 떨어져서 컨텍스트의 '형식'도 중요하다.
핵심 요약
- OPSD의 이득이 '정답 전달'인지 '컨텍스트 유도 행동'인지 구분하는 통제 실험(OP2SD)을 설계했다.
- 정답 대신 다른 수학 문제의 풀이를 선생님에게 줘도 OPSD와 비슷한 성능 향상이 나타났다.
- 수학이 아닌 물리 문제를 컨텍스트로 주면 효과가 떨어져서, 컨텍스트의 도메인 일치가 필요함을 밝혔다.
- 세 Qwen3 모델(1.7B, 4B, 8B)과 AIME/HMMT 벤치마크에서 일관된 패턴을 확인했다.
- OPSD를 '특권 정보 전달'로만 해석하면 안 되며 컨텍스트 유도 행동도 중요한 요인임을 입증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.