Learning from the Self-future: On-policy Self-distillation for dLLMs

발행일
출처
arXiv
논문 번호
448
분야
LLMs / NLP
arXiv 번호
2606.18195

확산 LLM(dLLM)용 최초 온정책 자기증류 프레임워크. 자기 생성 답안을 suffix로 활용하고 step-level 감독으로 RLVR 대비 10% 스텝으로 우수 성능.

d-OPSD는 확산 LLM(dLLM)을 위한 최초의 온정책 자기증류 프레임워크다. 자기 회귀 모델의 prefix conditioning과 달리, dLLM의 비자기회귀 특성을 활용해 자기 생성 답안을 suffix 조건부로 사용하여 'self future-experience'에서 학습한다. token-level 대신 step-level 발산 감독을 적용하여 dLLM의 반복적 denoising 과정과 정렬한다.

핵심 요약

  • 기존 OPSD가 자기회귀 모델에만 설계된 한계를 극복한 최초의 dLLM용 온정책 자기증류 프레임워크
  • dLLM의 비자기회귀 특성을 활용, 자기 생성 답안을 suffix 조건부로 사용하여 더 많은 새 지식 전달
  • token-level → step-level 발산 감독으로 dLLM의 반복 denoising 구조와 정렬
  • RLVR 대비 약 10% 최적화 스텝만으로 우수한 추론 성능 달성하여 sample efficiency 획기적 향상
  • 4개 추론 벤치마크에서 RLVR 및 SFT 기준선 일관되게 능가
  • 사람이 '과거로 돌아갈 수 있다면'이라는 영감과 유사한 self future-experience 학습 패러다임 제안

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)