SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 915
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.14277
긴 문맥을 쓰는 강한 수학 모델의 추론을, 문장을 나누는 방식이 다른 짧은 문맥 모델에도 안정적으로 옮기는 방법이다.
이 논문은 한마디로 문장을 토큰으로 나누는 방식이 서로 다른 모델 사이에서도 추론 능력을 옮기는 SimpleOPD를 제안한다. 학생 모델이 직접 만든 답을 교사 모델이 평가하며 배우고, 두 모델에서 같은 문자열 구간을 차지하는 토큰만 연결한다. 종료 토큰에 대한 교사 모방 손실을 제외하고 초기 학생 모델과 출력 분포가 지나치게 멀어지지 않게 제한해 답변 길이 폭증과 잘림을 줄였다. 여러 학생 모델의 수학 증명과 일부 과학 문제 성능이 올랐지만, 토큰 분할 차이가 큰 모델에서는 일부 점수가 떨어졌다.
핵심 요약
- 두 모델에서 같은 문자열 구간을 차지하는 토큰만 교사 모델의 점수와 연결하고, 맞지 않는 부분에는 학생 모델 자체의 점수를 사용한다.
- 교사 모델은 10만 토큰이 넘는 추론이 가능한 SU-01이다. 학생 모델은 Qwen3, Qwen3.5, Intern-S2, GLM-4.7과 Gemma-4 계열이다.
- ProofBench는 DeepSeek-V4-Flash가 채점했으며 Intern-S2의 점수는 21.70에서 44.50으로 올랐다. AnswerBench는 76.03에서 80.10, AIME25는 88.33에서 95.00으로 올랐다.
- 수학 자료만으로 학습했지만 Intern-S2의 HiPhO 점수는 38.6에서 41.1, FrontierScience Research는 1.7에서 5.0으로 올랐다.
- 종료 토큰의 교사 모방 손실을 제외하고 초기 학생 모델과의 출력 분포 차이를 제한하자 답변 잘림 비율이 거의 0까지 낮아졌다. 다만 Gemma의 AnswerBench는 68.8에서 67.5로 떨어져 모든 능력이 함께 좋아진 것은 아니다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.