Trajectory-Refined Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 381
- 분야
- AI / General
- arXiv 번호
- 2606.08432
On-policy distillation의 구조적 한계인 prefix failure를 규명하고, trajectory-level 정제를 통해 이를 해결하는 TRD(Trajectory-Refined Distillation) 방법을 제안했다.
On-policy distillation(OPD)에서 학생 모델의 롤아웃이 잘못된 추론 경로를 따르면 teacher 분포가 bimodal mixture가 되어 token-level loss 개선만으로는 해결할 수 없는 prefix failure가 발생한다. TRD는 권한 정보(privileged information)를 활용해 학생의 원시 롤아웃을 정제된 궤적으로 수정한 뒤 이를 distillation에 사용한다. 수학·코드 벤치마크 전반에서 일관된 성능 향상을 보이며, 특히 AMOBench에서 Qwen3-8B 기준 ~50% 상대 향상을 달성했다.
핵심 요약
- OPD의 prefix failure 문제를 최초로 공식화 — 토큰 수준 개선으로는 근본 해결 불가
- TRD: trajectory-level 정제로 on-policy 지지 영역 내에서 궤적 수정 후 distillation 수행
- OPD와 OPSD(self-distillation) 모두에 적용 가능, Qwen3 모델군 전반에서 일관된 성능 향상
- AMOBench에서 Qwen3-8B 기준 ~50% 상대 향상(Pass@16), 정제된 궤적 길이 ~9배 압축
- 기존 토큰 수준 loss 개선(clip, reweight, top-K) 방법들을 능가하는 trajectory-level 접근
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.